博客
关于我
理解MapReduce原理_mr
阅读量:374 次
发布时间:2019-03-05

本文共 960 字,大约阅读时间需要 3 分钟。

用自己的话概况一下

MapReduce是一个基于集群的计算平台,是一个简化分布式编程的计算框架,是一个将分布式计算抽象为Map和Reduce两个阶段的编程模型。(这句话记住了是可以用来装逼的)

基本概念–job和task

作业job是客户端要求执行的一个工作单元

– 输入数据、MapReduce程序、配置信息
任务task是MapReduce将作业拆成的小单元
– map任务和reduce任务
• Job Tracker节点(master)
– 调度task在Task Tracker上运行,协调所有作业运行
– 如果一个task失败,Job Tracker指定一个Task Tracker重新开始
• Task Tracker节点(worker)
– 执行任务,发送进度报告

分片的定义

– MapReduce把输入的数据划分成等长的小数据块,称为输入分片input split,简称分片

• 分片大小

– 分片越小,负载越平衡
– 异构时根据计算机性能分配任务个数
– 失败重启更加平衡
– 分片越小,框架开销越大

每个分片一个map任务

– 管理分配的总时间和构建map任务时间变大
– 默认HDFS块大小,128MB

• 计算数据本地化

– 在本地存有HDFS数据的节点上运行map任务
在这里插入图片描述
图解:
在这里插入图片描述

MapReduce详细过程

• 一个split(切片)起一个map任务

• map输出时会先将输出中间结果写入到buffer中 • 在buffer中对数据进行partition(分区,partition数为reduce数)和基于key的sort(排序),达到阈
值后spill到本地磁盘
• 在map任务结束之前,会对输出的多个文件进行merge(合并),合并成一个文件
• 每个reduce任务会从多个map输出中拷贝自己的partition
• reduce也会将数据先放到buffer中,达到阈值会写到磁盘
• 当数据该reduce的map输出全部拷贝完成,合并多个文件成一个文件,并保持基于key的有序
• 最后,执行reduce阶段,运行我们实现的reduce中化简逻辑,最终将结果直接输出到HDFS中

可以参考这:

https://www.jianshu.com/p/ca165beb305b

转载地址:http://varg.baihongyu.com/

你可能感兴趣的文章
NIFI1.21.0/NIFI1.22.0/NIFI1.24.0/NIFI1.26.0_2024-06-11最新版本安装_采用HTTP方式_搭建集群_实际操作---大数据之Nifi工作笔记0050
查看>>
NIFI1.21.0_java.net.SocketException:_Too many open files 打开的文件太多_实际操作---大数据之Nifi工作笔记0051
查看>>
NIFI1.21.0_Mysql到Mysql增量CDC同步中_日期类型_以及null数据同步处理补充---大数据之Nifi工作笔记0057
查看>>
NIFI1.21.0_Mysql到Mysql增量CDC同步中_补充_插入时如果目标表中已存在该数据则自动改为更新数据_Postgresql_Hbase也适用---大数据之Nifi工作笔记0058
查看>>
NIFI1.21.0_Mysql到Mysql增量CDC同步中_补充_更新时如果目标表中不存在记录就改为插入数据_Postgresql_Hbase也适用---大数据之Nifi工作笔记0059
查看>>
NIFI1.21.0_NIFI和hadoop蹦了_200G集群磁盘又满了_Jps看不到进程了_Unable to write in /tmp. Aborting----大数据之Nifi工作笔记0052
查看>>
NIFI1.21.0_Postgresql和Mysql同时指定库_指定多表_全量同步到Mysql数据库以及Hbase数据库中---大数据之Nifi工作笔记0060
查看>>
NIFI1.21.0最新版本安装_连接phoenix_单机版_Https登录_什么都没改换了最新版本的NIFI可以连接了_气人_实现插入数据到Hbase_实际操作---大数据之Nifi工作笔记0050
查看>>
NIFI1.21.0最新版本安装_配置使用HTTP登录_默认是用HTTPS登录的_Https登录需要输入用户名密码_HTTP不需要---大数据之Nifi工作笔记0051
查看>>
NIFI1.21.0通过Postgresql11的CDC逻辑复制槽实现_指定表多表增量同步_增删改数据分发及删除数据实时同步_通过分页解决变更记录过大问题_02----大数据之Nifi工作笔记0054
查看>>
NIFI1.21.0通过Postgresql11的CDC逻辑复制槽实现_指定表多表增量同步_增加修改实时同步_使用JsonPath及自定义Python脚本_03---大数据之Nifi工作笔记0055
查看>>
NIFI1.21.0通过Postgresql11的CDC逻辑复制槽实现_指定表多表增量同步_插入修改删除增量数据实时同步_通过分页解决变更记录过大问题_01----大数据之Nifi工作笔记0053
查看>>
NIFI1.21.0通过Postgresql11的CDC逻辑复制槽实现_指定表或全表增量同步_实现指定整库同步_或指定数据表同步配置_04---大数据之Nifi工作笔记0056
查看>>
NIFI1.23.2_最新版_性能优化通用_技巧积累_使用NIFI表达式过滤表_随时更新---大数据之Nifi工作笔记0063
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_根据binlog实现update数据实时同步_实际操作05---大数据之Nifi工作笔记0044
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_根据binlog实现数据实时delete同步_实际操作04---大数据之Nifi工作笔记0043
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_配置binlog_使用处理器抓取binlog数据_实际操作01---大数据之Nifi工作笔记0040
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_配置数据路由_实现数据插入数据到目标数据库_实际操作03---大数据之Nifi工作笔记0042
查看>>
NIFI从MySql中增量同步数据_通过Mysql的binlog功能_实时同步mysql数据_配置数据路由_生成插入Sql语句_实际操作02---大数据之Nifi工作笔记0041
查看>>
NIFI从MySql中离线读取数据再导入到MySql中_03_来吧用NIFI实现_数据分页获取功能---大数据之Nifi工作笔记0038
查看>>