Spark生态系统

在大数据非常流行的今天,每个行业都在谈论大数据,每个公司(互联网公司,传统企业,金融行业等)都在讨论大数据。高层管理者利用大数据来进行决策;数据科学家利用大数据来进行业务创新;程序员利用大数据来完成项目或者产品。那么,作为大数据工程师需要掌握哪些知识呢?

其中Hadoop作为大数据处理的平台,凭借着出色的处理能力及大量的开源框架,越来越多地被大型公司采用,几乎成为了大数据的代名词。下面主要展示了Hadoop的生态圈。

每一个component都是一项技术,值得深入研究。基于一些性能的考虑,MapReduce逐渐地被Spark所取代。下面展示了Spark的生态系统。

参考资料:

大数据技术栈

Spark官网

Spark修炼之道

从入门到高深,Spark综合帖

RDD:基于内存的集群计算容错抽象

HDFS

Spark生态和架构

Spark-core架构及工作机制

Spark book

原文地址:https://www.cnblogs.com/allanli/p/5830227.html