孟红涛
- 作品数:2 被引量:13H指数:1
- 供职机构:国防科学技术大学计算机学院更多>>
- 发文基金:国家高技术研究发展计划更多>>
- 相关领域:自动化与计算机技术更多>>
- Spark内存管理及缓存策略研究被引量:13
- 2017年
- Spark系统是基于Map-Reduce模型的大数据处理框架。Spark能够充分利用集群的内存,从而加快数据的处理速度。Spark按照功能把内存分成不同的区域:Shuffle Memory和Storage Memory,Unroll Memory,不同的区域有不同的使用特点。首先,测试并分析了Shuffle Memory和Storage Memory的使用特点。RDD是Spark系统最重要的抽象,能够缓存在集群的内存中;在内存不足时,需要淘汰部分RDD分区。接着,提出了一种新的RDD分布式权值缓存策略,通过RDD分区的存储时间、大小、使用次数等来分析RDD分区的权值,并根据RDD的分布式特征对需要淘汰的RDD分区进行选择。最后,测试和分析了多种缓存策略的性能。
- 孟红涛余松平刘芳肖侬
- 关键词:大数据缓存策略
- Spark内存管理及缓存策略研究
- Spark系统是基于Map-Reduce模型的大数据处理框架,Spark能够充分利用集群的内存,从而加速数据的处理速度.Spark按照功能把内存分成不同的区域:Shuffle Memory、Storage Memory、...
- 孟红涛余松平刘芳肖侬
- 关键词:缓存策略