srcmini - 专业IT技术分析博客srcmini

个性化阅读
专注于IT技术分析

最新文章 第2072页

Hadoop教程介绍-srcmini
Hadoop

Hadoop教程介绍

半瓶木阅读(1072)评论(0)赞(0)

本文概述 Hadoop索引 先决条件 听众 问题 Hadoop教程提供了Hadoop的基本和高级概念。我们的Hadoop教程专为初学者和专业人士设计。 Hadoop是一个开源框架。它由Apache提供, 用于处理和分析大量数据。它是用Jav...

Hadoop

Hadoop安装详细步骤

半瓶木阅读(1115)评论(0)赞(0)

本文概述 1)Java安装 2)SSH安装 3)Hadoop安装 Hadoop所需的环境:Hadoop的生产环境是UNIX, 但也可以在使用Cygwin的Windows中使用。需要Java 1.6或更高版本才能运行Map Reduce程序。...

Hadoop

HDFS功能和目标

半瓶木阅读(1103)评论(0)赞(0)

本文概述 HDFS的功能 HDFS的目标 Hadoop分布式文件系统(HDFS)是一个分布式文件系统。它是Hadoop的核心部分, 用于数据存储。它旨在在商用硬件上运行。 与其他分布式文件系统不同, HDFS具有高度的容错能力, 可以部署在...

Hadoop

Hive动态分区

半瓶木阅读(1118)评论(0)赞(0)

在动态分区中, 表中存在分区列的值。因此, 不需要手动传递分区列的值。 首先, 选择我们要在其中创建表的数据库。 使用以下命令启用动态分区:- 创建一个虚拟表来存储数据。 现在, 将数据加载到表中。 使用以下命令创建分区表:- 现在, 将虚...

MapReduce中的数据流-srcmini
Hadoop

MapReduce中的数据流

半瓶木阅读(1039)评论(0)赞(0)

MapReduce用于计算大量数据。为了以并行和分布式的形式处理即将到来的数据, 数据必须来自各个阶段。 MapReduce数据流的阶段 输入阅读器 输入读取器读取即将到来的数据, 并将其拆分为适当大小(64 MB至128 MB)的数据块。...

Hadoop

Hive中的桶

半瓶木阅读(1045)评论(0)赞(0)

Hive中的存储桶是一种数据组织技术。它类似于Hive中的分区功能, 具有将功能强大的功能将大型数据集划分为更易于管理的部分(称为存储桶)的功能。因此, 当分区的实现变得困难时, 我们可以在Hive中使用存储桶。但是, 我们还可以在存储分区...

Hadoop

Apache Spark字数示例

半瓶木阅读(1041)评论(0)赞(0)

在Spark单词计数示例中, 我们发现每个单词在特定文件中存在的频率。在这里, 我们使用Scala语言执行Spark操作。 执行Spark单词计数示例的步骤 在此示例中, 我们找到并显示每个单词的出现次数。 在本地计算机上创建一个文本文件,...

Apache Spark教程-srcmini
Hadoop

Apache Spark教程

半瓶木阅读(1117)评论(0)赞(0)

本文概述 先决条件 听众 问题 Apache Spark教程提供了Spark的基本和高级概念。我们的Spark教程专为初学者和专业人士设计。 Spark是用于大规模数据处理的统一分析引擎, 包括用于SQL, 流, 机器学习和图形处理的内置模...

Hadoop

RDD共享变量

半瓶木阅读(1126)评论(0)赞(0)

本文概述 广播变量 累加器 在Spark中, 当任何函数传递给转换操作时, 它将在远程集群节点上执行。它适用于函数中使用的所有变量的不同副本。这些变量将复制到每台计算机, 并且远程计算机上的变量的任何更新都不会还原到驱动程序。 广播变量 广...

Hadoop

RDD持久性

半瓶木阅读(1017)评论(0)赞(0)

通过将数据持久存储在操作中的内存中, Spark提供了一种方便的方法来处理数据集。在保留RDD时, 每个节点都会将其计算的所有分区存储在内存中。现在, 我们还可以在该数据集的其他任务中重用它们。 我们可以使用persist()或cache(...