首页 > 其他 > 详细

RDD算子、RDD依赖关系

时间:2018-11-29 23:51:46      阅读:127      评论:0      收藏:0      [点我收藏+]

RDD:弹性分布式数据集, 是分布式内存的一个抽象概念

RDD:1.一个分区的集合,

    2.是计算每个分区的函数 ,

      3.RDD之间有依赖关系

      4.一个对于key-value的RDD的Partitioner

           5.一个存储存取每个Partition的优先位置的列表

RDD算子:

Transformations:不会立即执行,只是记录这些操作

Actions:计算只有在action被提交的时候才被触发。

RDD依赖关系:

窄依赖指的是每一个父RDDPartition最多被子RDD的一个Partition使用

 

宽依赖指的是多个子RDDPartition会依赖同一个父RDDPartition

 

RDD算子、RDD依赖关系

原文:https://www.cnblogs.com/dummyly/p/10041617.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!