hadoop

hadoop启动时报错process information unavailable

启动hadoop，jps查看报错 [root@slave1 home]# jps 7798 -- process information unavailable 7081 -- process information unavailable 查看进程是否存在 [root@slave1 home]# ......

information unavailable 时报 process hadoop更新时间 2023-12-18

Hadoop的“前世今生”

Hello，小伙伴们，作为大数据的第一篇博文，肯定要先介绍一下大数据中的“大哥大”Hadoop了，别急，咱们慢慢介绍。一：Hadoop名称由来与很多其他的开源框架不同，Hadoop的名字并不是一个缩写，而是一个生造出来的词。据说是Hadoop之父Doug Cutting用儿子毛绒玩具大象的名字命 ......

Hadoop更新时间 2023-12-18

Hadoop Yarn Tool接口接入

项目搭建参考 Java实现对Hadoop HDFS的API操作 1.驱动类 package cn.coreqi.mapreduce.tool; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.util.Too ......

接口 Hadoop Yarn Tool更新时间 2023-12-17

Hadoop Yarn 调度器多队列

1.容量调度器多队列 1.为何需要多队列调度器默认就1个default队列，不能满足生产的要求。 1个队列在任务极限的情况下，容易资源耗尽。特殊时期通过对任务的区分可以保证重要的任务队列资源充足按照框架区分队列，如hive/spark/flink 每个框架的任务放入指定的队列(企业用的不是特别 ......

队列 Hadoop Yarn更新时间 2023-12-17

Hadoop YARN生产环境核心配置参数

1.ResourceManager相关配置参数说明默认值备注 yarn.resourcemanager.scheduler.class 配置调度器,默认为容量调度器(Apache) org.apache.hadoop.yarn.server.resourcemanager.scheduler ......

核心参数环境 Hadoop YARN更新时间 2023-12-17

Hadoop YARN

1.Yarn资源调度器 Yarn是一个资源调度平台，负责为运算程序提供服务器运算资源，相当于一个分布式的操作系统平台，而MapReduce等运算程序则相当于运行于操作系统之上的应用程序。 1.Yarn基础架构 Yarn主要由ResourceManager、NodeManager、Applicatio ......

Hadoop YARN更新时间 2023-12-16

Hadoop 数据压缩

1.概述 1.好处 & 坏处优点：减少磁盘IO、减少磁盘存储空间缺点：增加CPU开销 2.压缩的原则运算密集型的Job，少用压缩 IO密集型的Job，多用压缩 2.MR 支持的压缩编码 1.压缩算法对比介绍压缩格式 Hadoop自带? 算法文件扩展名是否可切片换成压缩格式后,原来的程序 ......

数据 Hadoop更新时间 2023-12-16

Hadoop快速入门

Hadoop快速入门一、大数据思维分而治之所谓“分而治之”，就是把一个复杂的算法问题按一定的“分解”方法分为等价的规模较小的若干部分，然后逐个分别找出各部分的解，再把各部分的解组成整个问题的解。传统的计算都是基于内存去完成的，但是内存是有限的，数据量太大，导致无法在较短时间内迅速解决，也就是 ......

Hadoop更新时间 2023-12-16

Hadoop MapReduce框架原理

1.InputFormat数据输入 1.数据切片与MapTask并行度决定机制一个Job的Map阶段并行度由客户端在提交Job时的切片数决定每一个Split切片分配一个MapTask并行实例处理默认情况下，切片大小 = BlockSize 切片时不考虑数据集整体，而是逐个针对每一个文件单独切片 ......

MapReduce 框架原理 Hadoop更新时间 2023-12-14

Hadoop 数据类型及序列化

1.Hadoop数据类型 Java类型 Hadoop Writable类型 Boolean BooleanWritable Writable Writable Writable Writable Writable Writable Writable Writable Writable 2.为何Had ......

序列类型数据 Hadoop更新时间 2023-12-13

Hadoop MapReduce编程规范

用户编写的程序分为三个部分:Mapper、Reducer和Driver 1.Mapper阶段用户自定义的Mapper要继承自己的父类 Mapper的输入数据是KV对的形式（KV的类型可自定义） Mapper中的业务逻辑写在map()方法中 Mapper的输出数据是KV对的形式（KV的类型可自定义） ......

MapReduce Hadoop更新时间 2023-12-13

Hadoop NameNode(SecondaryNameNode) Fsimage和Edits解析

NameNode被格式化之后，将在NameNode目录下产生一些文件 1.Fsimage文件 Fsimage文件是HDFS文件系统元数据的一个永久性的检查点，其中包含HDFS文件系统的所有目录和文件inode的序列化信息 2.Edits文件 Edits文件存放了HDFS文件系统的所有更新操作的路径， ......

SecondaryNameNode NameNode Fsimage Hadoop Edits更新时间 2023-12-12

Hadoop 配置的优先级

从低到高 1.默认配置默认文件文件存放在Hadoop的jar包中的位置 core-default.xml hadoop-common-3.3.6.jar/core-default.xml hdfs-default.xml hadoop-hdfs-3.3.6.jar/hdfs-default.xm ......

优先级 Hadoop更新时间 2023-12-11

Java实现对Hadoop HDFS的API操作

1.配置Hadoop的Windows客户端 Hadoop 配置Windows 客户端 2.新建Maven项目[略] 3.添加依赖  <dependen ......

Hadoop Java HDFS API更新时间 2023-12-10

Hadoop 配置Windows 客户端

1.根据Hadoop版本下载Windows依赖，并放置到非中文目录下 https://github.com/cdarlint/winutils 2.配置环境变量 HADOOP_HOME -> 放置的目录地址 PATH -> 追加%HADOOP_HOME%\bin 3.测试环境双击winutils. ......

客户端 Windows 客户 Hadoop更新时间 2023-12-10

Hadoop HDFS 文件块大小

HDFS中的文件在物理上是分块存储(Block),块的大小可以通过配置参数(dfs.blocksize)来配置，默认大小在Hadoop2.x/3.x版本中是128M，1.x版本中是64M. 建议配置为物理机硬盘每秒的读取速度,如机械硬盘则建议为128M，SSD则配置为256M。 ......

大小文件 Hadoop HDFS更新时间 2023-12-10

基于Docker容器搭建hadoop完全分布式集群环境

简介物理机：windows10 宿主机：Centos7虚拟机，需要安装Docker服务 hadoop集群节点：3个centos7的容器，hadoop1、hadoop2、hadoop3 组件：容器镜像：Centos7 Docker CE 24.0.7 JDK1.8.0_181 Hadoop3.1. ......

分布式集群容器环境 Docker更新时间 2023-12-10

Hadoop 常用端口号

端口名称 Hadoop2.x Hadoop3.x HDFS NameNode内部通信端口 8020 / 9000 8020 / 9000 / 9820 HDFS NameNode HTTP UI 50070 9870 YARN MapReduce查看执行任务端口 8088 8088 历史服务器通信端 ......

口号常用 Hadoop更新时间 2023-12-09

虚拟机运行Hadoop | 各种问题解决的心路历程

ps：完成大数据技术实验报告的过程，出项各种稀奇古怪的问题。(知道这叫什么吗？经济基础决定上层建筑，我当时配置可能留下了一堆隐患，总之如果有同样的问题，希望可以帮到你) 一、虚拟机网络连接不通的各种情况我这里遇到的是，三台虚拟机，两台piing百度不同原因：改了下内存，重启就又未知的网络名称解 ......

心路历程 Hadoop 问题更新时间 2023-12-07

hive执行sql报错 FAILED: Execution Error, return code 3 from org.apache.hadoop.hive.ql.exec.mr.MapredLocalTask

前言：执行hive sql报错，sql逻辑是两个表左连接并将数据插入新的表中。报错信息： [ERROR] 2023-12-05 15:49:49.165 +0800 - execute sql error: Error while processing statement: FAILED: Ex ......

hive MapredLocalTask Execution FAILED apache更新时间 2023-12-06

hadoop大数据安装

一、hadoop的安装1、hadoop的安装wget https://archive.apache.org/dist/hadoop/common/hadoop-3.1.3/hadoop-3.1.3.tar.gz2、解压tar -zxvf hadoop-3.1.3.tar.gz -C /opt/mod ......

数据 hadoop更新时间 2023-12-05

hadoop优化之yarn调优

yarn.nodemanager.resource.memory-mb表示该节点上YARN可使用的物理内存总量，默认是8192（MB），注意，如果你的节点内存资源不够8GB，则需要调减小这个值，而YARN不会智能的探测节点的物理内存总量。 yarn.nodemanager.vmem-pmem-rat ......

hadoop yarn更新时间 2023-12-05

start-dfs.sh启动hadoop，jps没显示

查看当前系统的名称 [root@master dfs]# cat /etc/hosts 192.168.128.78 hadoop01 查看core-site.xml <property> <name>fs.defaultFS</name> <value>hdfs://hadoop01:9000</ ......

start-dfs hadoop start dfs jps更新时间 2023-12-05

关于hadoop hive中使用hive分区功能

很多人习惯了使用第三方的工具去连接hive或者hbase数据库，并且使用其中的sql编辑器进行失去了语句的使用来进行数据的分析等一系列的操作，但是一些shell命令也可以在其中运行例如： 1. set hive.exec.dynamic.partition=true; 2. set hiv ......

hive 功能 hadoop更新时间 2023-12-05

七、Hadoop优化

优化1：Combiner 使用之前使用之后减少的了reduce 从map拉取数据的过程，提高计算效率。 hadoop 的计算特点：将计算任务向数据靠拢，而不是将数据向计算靠拢。特点：数据本地化，减少网络io。首先需要知道，hadoop数据本地化是指的map任务，reduce任务并不具备数据本 ......

Hadoop更新时间 2023-12-04

centos7.5 hadoop NAT 静态IP网络环境搭建

1 设置 VMware 网络环境 1. 选择VMNet8 并将子网IP 修改为 192.168.10.0，保证集群ip都在这个网段下 2. 选择NAT 设置，配置NAT的网关为 192.168.10.2 2 设置 windows11 网络环境 1. 打开控制面板\网络和 Internet\网络连接 ......

静态 centos7 环境 centos hadoop更新时间 2023-12-03

Hadoop集群部署后相关WEB界面打不开大概原因

集群部署完毕后，查看相关WEB界面，打不开的原因可能如下： 1、可以先去检查LINUX（CentOS7）机器的防火墙是否关闭，命令如下： systemctl status firewalld.service （查看防火墙状态） (如果显示为关闭状态，则进行下一步；如果显示尚未关闭，则进行关闭并设定 ......

集群界面原因 Hadoop WEB更新时间 2023-12-03

安装hadoop

hadoop:https://blog.csdn.net/weixin_44898710/article/details/109832031 将压缩包上传到服务器 # 上传到/home/software路径 # 设置权限 chmod 755 hadoop-3.2.1.tar.gz # 解压 tar ......

hadoop更新时间 2023-12-01

Hadoop 一些脚本总结

1.各个模板分开启动/停止 1.整体启动/停止 HDFS start-dfs.sh / stop-dfs.sh 2.整体启动/停止 YARN start-yarn.sh / stop-yarn.sh 2.各个服务组件逐一启动/停止 1.分别启动/停止 HDFS组件 hdfs --daemon sta ......

脚本 Hadoop更新时间 2023-12-01

共334篇 :2/12页 首页上一页12345下一页尾页

526互联