Hadoop生态圈分层完整图谱结构
| 层级分类 | 核心功能 | 核心组件 |
| 核心基础层 | 底层存储、资源与计算核心 | HDFS(分布式文件系统)、YARN(分布式资源调度)、MapReduce(离线计算框架) |
| 计算引擎层 | 数据处理计算框架 | Spark(内存计算框架)、Flink(实时流计算)、Tez(DAG计算模型) |
| 存储查询层 | 结构化/半结构化存储与查询 | HBase(分布式NoSQL列存数据库)、Hive(数据仓库)、Impala、Presto(交互式查询)、Iceberg(开放表格式) |
| 数据接入层 | 数据采集与同步 | Flume(日志采集工具)、Sqoop(结构化数据同步)、Kafka(消息队列缓存) |
| 调度与管控层 | 工作流调度、集群运维管理 | Oozie(工作流调度)、ZooKeeper(分布式协调服务)、Ambari(集群部署运维) |
| 数据治理层 | 权限与数据管理 | Ranger、Sentry(权限管控)、HCatalog(表与存储管理) |
| 机器学习层 | 数据挖掘与算法库 | Spark MLlib(分布式机器学习库)、Mahout(传统数据挖掘工具) |
核心组件位置关系
核心协同链路为:Fluent/Sqoop 采集数据 → HDFS 持久化存储 → YARN 分配集群资源 → MapReduce/Spark/Flink 处理数据 → Hive 简化分析流程/HBase 提供实时读写 → Oozie 调度作业 → ZooKeeper 协调集群状态,所有上层组件都直接或间接依赖HDFS的底层存储能力。
