Hadoop生态圈分层完整图谱结构

Hadoop生态圈分层完整图谱结构

层级分类 核心功能 核心组件
核心基础层 底层存储、资源与计算核心 HDFS(分布式文件系统)、YARN(分布式资源调度)、MapReduce(离线计算框架)
计算引擎层 数据处理计算框架 Spark(内存计算框架)、Flink(实时流计算)、Tez(DAG计算模型)
存储查询层 结构化/半结构化存储与查询 HBase(分布式NoSQL列存数据库)、Hive(数据仓库)、Impala、Presto(交互式查询)、Iceberg(开放表格式)
数据接入层 数据采集与同步 Flume(日志采集工具)、Sqoop(结构化数据同步)、Kafka(消息队列缓存)
调度与管控层 工作流调度、集群运维管理 Oozie(工作流调度)、ZooKeeper(分布式协调服务)、Ambari(集群部署运维)
数据治理层 权限与数据管理 Ranger、Sentry(权限管控)、HCatalog(表与存储管理)
机器学习层 数据挖掘与算法库 Spark MLlib(分布式机器学习库)、Mahout(传统数据挖掘工具)

核心组件位置关系

核心协同链路为:Fluent/Sqoop 采集数据 → HDFS 持久化存储 → YARN 分配集群资源 → MapReduce/Spark/Flink 处理数据 → Hive 简化分析流程/HBase 提供实时读写 → Oozie 调度作业 → ZooKeeper 协调集群状态,所有上层组件都直接或间接依赖HDFS的底层存储能力。

f9aefee3dd6ebe0741328fcca705f631

滚动至顶部