hadoop spark

spark学习

Spark运行特点：每个Application获取专属的executor进程，该进程在Application期间一直驻留，并以多线程方式运行Task。这种Application隔离机制是有优势的，无论是从调度角度看（每个Driver调度他自己的任务），还是从运行角度看（来自不同Applicatio ......

spark更新时间 2023-10-26

云计算-hadoop的安装

云计算的课程，主要还是要梳理逻辑（尽管我不是做这个方向的，但是课程还是要好好完成！）前提：安装好虚拟机VirtualBox，并且下载好Ubuntu的光盘映像文件。文章思路： 1.配环境（SSH免密码登录，JAVA环境）２.配Hadoop（下载包，配置相应的环境）３.运行（感受一下实际例子） ......

hadoop更新时间 2023-10-26

Hadoop-大数据组件版本号查看

1．操作系统 cat /etc/redhat-release ; 2．JDK java -version 3．SCALA scala --version 4．MySQL mysql --version 5．Zookeeper ps -ef | grep -E “zookeeper-.*.jar” 6 ......

组件版本数据 Hadoop更新时间 2023-10-26

火山引擎 LAS Spark 升级：揭秘 Bucket 优化技术

更多技术交流、求职机会，欢迎关注字节跳动数据平台微信公众号，回复【1】进入官方交流群文章介绍了 Bucket 优化技术及其在实际业务中的应用，包括 Spark Bucket 的基本原理，重点阐述了火山引擎湖仓一体分析服务 LAS（下文以 LAS 指代）Spark 对 Bucket 优化的功能增强， ......

火山引擎 Bucket Spark 技术更新时间 2023-10-25

【1】基于docker搭建hadoop+hive+spark+hbase+zookeeper+scale集群

1、设置主机上的虚拟缓存当本地内存不足时，可以使用虚拟内存将一些内存数据转移到硬盘上，从而扩展计算机的内存容量。这样可以让计算机运行更复杂、更占用内存的程序，不会出现内存不足的情况。减轻物理存储器不足的压力，设置虚拟内存可以在内存不够的情况下将缓存一时放在硬盘上，解决内存不足问题。通过虚拟内存， ......

集群 zookeeper docker hadoop hbase更新时间 2023-10-24

基于docker容器，搭建hadoop+spark+hive+hbase+Zookeeper Scala集群

1.安装Docker和Docker Compose 2.下载镜像 docker pull bde2020/hadoop-base:2.0.0-hadoop3.2.1-java8 docker pull bde2020/hadoop-namenode:2.0.0-hadoop3.2.1-java8 d ......

集群容器 Zookeeper docker hadoop更新时间 2023-10-24

虚拟机的Spark安装步骤

相关代码截图 //解压压缩包 tar -zxvf spark-3.2.4-bin-hadoop3.2.tgz //配置环境变量 vi /etc/profile //添加内容 # spark $PARK_HOME=/export/server/spark-3.2.4-bin-hadoop3.2 exp ......

步骤 Spark更新时间 2023-10-23

两台实体机器4个虚拟机节点的Hadoop集群搭建（Ubuntu版）

安装Ubuntu Linux元信息两台机器，每台机器两台Ubuntu Ubuntu版本：ubuntu-22.04.3-desktop-amd64.iso 处理器数量2，每个处理器的核心数量2，总处理器核心数量4 单个虚拟机内存8192MB（8G），最大磁盘大小30G 参考链接清华大学开源软件镜像 ......

节点集群实体机器 Hadoop更新时间 2023-10-22

报错Failed to execute spark task, with exception 'org.apache.hadoop.hive.ql.metadata.HiveException(Failed to create Spark client for Spark session 768047b9-c7f7-459f-9220-5d8d7bdabefe)

在执行hive on spark的时候上面的错误可能有以下几种问题： 1.版本问题不匹配 2.时间参数问题设置的参数太小了 3.在hive-site.xml文件中没有配置spark 的home 我的问题属于第一个问题导致没有跑成功当时也在想是不是内存出现了问题 ......

Failed Spark HiveException exception 7bdabefe更新时间 2023-10-22

hadoop集群大数据项目实战_电信用户行为分析_day04

进行HIVE环境配置 1.上传相关的包 2.对上传的包进行下载和创建软连接 3.配置相关的文件 4.分别发送给其他机子假设你需要在所有机器执行同一个指令，则你就需要相关设置 5.在hive的onf文件中创建hive-site.xml进行相关设置 ```xml<configuration> <-- ......

行为分析大数集群实战行为更新时间 2023-10-20

hadoop官方文档解读

Hadoop是一个分布式计算框架，用于存储和处理大规模数据集。首先搞清楚为什么需要使用Hadoop Hadoop进行数据处理可以充分利用分布式计算和存储的优势，适用于大规模数据的批处理和分布式计算场景。裸机上进行数据处理则更适合小规模数据或需要实时处理的场景。在裸机上进行数据处理和使用Hado ......

文档官方 hadoop更新时间 2023-10-20

Hadoop 1

hadoop 的核心架构：包括hdfs 和 mapReduce, HDFS 为海量数据提供了存储，而MapReduce 为海量数据提供了计算框架。 HBase：实时分布式数据库，MapReduce：分布式计算框架，HDFS：分布式文件系统。 HDFS中包含三个重要角色： NameNode, Data ......

Hadoop更新时间 2023-10-20

【大数据】Spark On Yarn 理解（图文）

基本架构 1：ResourceManager（资源管理器）：ResourceManager是YARN的核心组件，负责管理和分配集群资源。它接收来自Spark应用程序的资源请求，并根据可用资源情况进行分配和调度。 2：NodeManager（节点管理器）：NodeManager是每个节点上的代理程序， ......

图文数据 Spark Yarn On更新时间 2023-10-19

【大数据】Spark部署与启动（文档）

Python 环境准备 Anaconda3： https://pan.baidu.com/s/1e4Wx48RsW0Pm_saotxTW4A?pwd=66ki [root@test1 ~]# cd /export/ [root@test1 export]# rz # 上传源文件包 [root@tes ......

文档数据 Spark更新时间 2023-10-19

hadoop集群大数据项目实战_电信用户行为分析_day03

配置系统环境 Reis 1.先把之前的dump.rdb删除掉 rm -rf dump.rdb 2.把原始项目给的dump.rdb 放进来，它里面包含了需要的数据，比如端口；在这部之前必须要进行关闭端口，随后传送文件，最后重启端口相关指令: bin/redis-server conf/redis.c ......

行为分析大数集群实战行为更新时间 2023-10-19

LAS Spark+云原生：数据分析全新解决方案

更多技术交流、求职机会，欢迎关注字节跳动数据平台微信公众号，回复【1】进入官方交流群随着数据规模的迅速增长和数据处理需求的不断演进，云原生架构和湖仓分析成为了现代数据处理的重要趋势。在这个数字化时代，企业面临着海量数据的挑战和机遇，而构建可扩展、灵活且高效的数据分析平台成为了迫切的需求。文章主要 ......

数据分析解决方案全新方案数据更新时间 2023-10-18

spark sql使用--创建SparkDataFrame

Spark SQL模块这个模块是Spark中用来处理结构化数据的，提供一个叫SparkDataFrame的东西并且自动解析为分布式SQL查询数据。在RDD阶段，程序的执行入口对象是： SparkContext 在Spark 2.0后，推出了SparkSession对象，作为Spark编码的统一入 ......

SparkDataFrame spark sql更新时间 2023-10-17

hadoop集群大数据项目实战_电信用户行为分析_day02

集群配置好后，运行一个小例子，统计单词 1.hdfs dfs -put 将本地系统的文件或文件夹复制到HDFS上 2.hdfs dfs -ls /output 将所有的文件显示出来 3.hdfs dfs -cat /output/ 将所有的文件读取出来下载part-r-000000 安装Redis ......

行为分析大数集群实战行为更新时间 2023-10-16

Spark入门指南：从基础概念到实践应用全解析

在这个数据驱动的时代，信息的处理和分析变得越来越重要。而在众多的大数据处理框架中，Apache Spark 以其独特的优势脱颖而出 ......

入门指南概念基础指南 Spark更新时间 2023-10-15

Hadoop-3.3.5 自动安装

Hadoop-3.3.5 自动安装脚本为了方便数据科学与大数据技术的 hadoop-3.3.5 安装与配置目前适用于新安装的纯净虚拟机，未配置冲突检测.. 所以安装的话请使用全新创建的机器以避免错误... 如何使用 ssh localhost 输入你目前用户的密码 exit 退出当前ssh终端（ ......

Hadoop更新时间 2023-10-14

hadoop集群大数据项目实战_电信用户行为分析_day01

上图是相关配置的要求，主要创建了四个虚拟系统，有三台虚拟机搭建hadoop集群，一台作为业务系统。涉及到相关的Linux指令有::set nu[显示行号] :6[到第6行 shift+G跳到最后一行进入vi指令后查找相关东西/(你需要查找的东西) 1.配置环境、第一步设置网络参数，设置静态网络 ......

行为分析大数集群实战行为更新时间 2023-10-14

基于Docker搭建Hadoop+Hive

基于Docker搭建Hadoop+Hive 本文主要是照搬这篇文章的https://zhuanlan.zhihu.com/p/242658224，但是这篇文章有一些细节配置没有讲清楚，这里对其进行完善零、环境信息电脑配置 Ubuntu 20.04.6 LTS (Focal Fossa) 5.15 ......

Docker Hadoop Hive更新时间 2023-10-13

Hadoop-Operation category READ is not supported in state standby 故障解决

在查询hdfs时或者执行程序向hdfs写入数据时遇到报错：Operation category READ is not supported in state standby 意思是：该主机状态为待机,不支持操作类别READ. 你会发现最基本的hdfs命令都不能执行，例如：hadoop fs -ls ......

Hadoop-Operation Operation supported category 故障更新时间 2023-10-13

Hadoop2伪分布式安装

最近有观看我主讲的《Hadoop基础与演练》课程的同学问到Hadoop环境到底应该怎么安装。Hadoop的安装其实非常的简单，网上有很多教程，官网也有示例。但是可能部分同学对于linux不太熟悉，导致安装的时候会遇到各种问题，打击学习激情。本文就来详细的讲解一下如何配置Hadoop2的伪分布式环境， ......

分布式 Hadoop2 Hadoop更新时间 2023-10-13

为什么物联网大数据平台，使用TDengine，可以不要Redis、Kafka和Spark等软件？

为什么物联网大数据平台，使用TDengine，可以不要Redis、Kafka和Spark等软件？ - TDengine | 涛思数据 (taosdata.com) TDengine是一高效的时序空间大数据处理引擎，因为充分利用物联网、车联网、工业互联网等场景的数据特点并做了很多优化，因此性能上远胜通 ......

TDengine 数据 Redis Kafka Spark更新时间 2023-10-12

Hadoop问题解决（5）

当一个HDFS系统同时处理许多个并行的put操作，往HDFS上传数据时，有时候会出现dfsclient 端发生socket 链接超时的报错，有的时候甚至会由于这种原因导致最终的put操作失败，造成数据上传不完整。log类似如下：All datanodes *** are bad. Aborting. ......

Hadoop 问题更新时间 2023-10-11

LAS Spark 在 TPC-DS 的优化揭秘

更多技术交流、求职机会，欢迎关注字节跳动数据平台微信公众号，回复【1】进入官方交流群文章主要介绍了火山引擎湖仓一体分析服务 LAS Spark（下文以 LAS Spark 指代）在 TPC-DS 上的性能突破与优化策略。TPC-DS 是一个模拟复杂数据仓库环境的测试基准，LAS Spark 通过采 ......

TPC-DS Spark LAS TPC DS更新时间 2023-10-11

在hadoop虚拟机里面使用hadoop jar运行打包文件，出现Exception in thread "main" org.apache.hadoop.ipc.RemoteException(org.apache.hadoop.ipc.RpcNoSuchProtocolException): Unknown protocol: org.apache.hadoop.的问题的解决

问题描述更改了JDK版本之后，再次运行又出现了这个错误：问题解决经过查阅相关资料，发现是自己定义的hdfs的路径不太对，本来写的是这样的：然后自己确实不记得配置环境时配置的是多少，就看了看这个文件core.site.xml: cat core-site.xml 然后看到这里：使用的端口号是 ......

hadoop apache org RpcNoSuchProtocolException quot更新时间 2023-10-10

1. Spark RDD

一、Spark RDD 1. RDD是什么 RDD，即弹性分布式数据集(Resilient Distributed Dataset)，是Spark对数据的抽象，本质上是分布在多个节点上的数据集合。弹性是指当内存不够时，数据可以持久化到磁盘，并且RDD具有高效的容错能力。分布式数据集是指一个数据集 ......

Spark RDD更新时间 2023-10-09

Spark 使用遇到的问题

Spark 使用遇到的问题环境信息 IDEA版本：Build #IU-232.8660.185, built on July 26, 2023 系统版本：Macos 14.0 Docker版本：一、Docker运行Spark集群这里使用bitnami发行的spark image github文 ......

问题 Spark更新时间 2023-10-08

共540篇 :6/18页 首页上一页3456789下一页尾页