SPARK组件

忍禁

关注

阅读 56

2022-12-07


SPARK组件_Streaming

1. Spark SQL 

支持多种数据源,包括 Hive,Avro,Parquet,ORC,JSON 和 JDBC

2. Spark Streaming

Spark Streaming 主要用于快速构建可扩展,高吞吐量,高容错的流处理程序。支持从 HDFS,Flume,Kafka,Twitter 和 ZeroMQ 读取数据,并进行处理

SPARK组件_大数据_02

Spark Streaming 的本质是微批处理,它将数据流进行极小粒度的拆分,拆分为多个批处理,从而达到接近于流处理的效果。

SPARK组件_大数据_03

3. MLlib

4. Graphx

GraphX 是 Spark 中用于图形计算和图形并行计算的新组件。

精彩评论(0)

0 0 举报