KNOWLEDGE MAP · 持续更新

大数据技术,
一张图看懂全貌。

从 Google 三篇论文到 AI-Native 数据栈,二十年间的大数据技术被拆成 22 个能力分层与 10 大技术派系。这里把开源生态与七朵云的对应产品放在同一张图上——不只是罗列名字,而是回答「这一层要解决什么问题、有哪些流派、云上买什么、自建装什么」。

进入分层图谱 →OPEN SOURCE × MULTI-CLOUD
MAP / 2026技术图谱
TECH MAP
能力分层
22 层 · 采集到应用全链路
技术派系
10 个 · 含中国开源派
云厂商
7 朵 · 海外 3 + 国内 4
22技术能力分层
10技术派系谱系
750+收录技术组件
7云厂商能力对照
01 / 技术派系

先看谱系,
再看组件。

大数据从来不是一个技术,而是十条互相竞争又互相吸收的技术路线。理解它们从哪来、解决什么问题,比背组件名字有用得多。

Google 三驾马车派THE THREE PAPERS

GFS、MapReduce、BigTable 三篇论文定义了「用廉价机器横向扩展处理海量数据」的范式:分布式存储 + 分布式计算 + 宽表存储。后续二十年的几乎所有系统,都是在回应或推翻这三篇论文。

GFS (2003)HDFS
MapReduce (2004)Hadoop MR
BigTable (2006)HBase
Dremel (2010)BigQuery / Impala / Drill

Hadoop 传统派THE HADOOP ECOSYSTEM

Yahoo 孵化、Cloudera / Hortonworks / MapR 三家商业化推动的完整生态。以 HDFS + YARN 为底座,用 Hive 把 SQL 翻译成 MapReduce,奠定了「数据湖」和离线数仓的工程范式。缺点是运维重、时延高,2019 年后逐步被云原生方案取代。

HDFS · YARN · MapReduce
Hive · HBase · Pig · Sqoop · Oozie
ZooKeeper · Ambari · Ranger · Atlas

Berkeley AMPLab 派BDAS · SPARK LINEAGE

加州伯克利 AMPLab 提出用内存 RDD 替代 MapReduce 的磁盘 Shuffle,把迭代计算提速一个数量级。Spark 一统批处理,随后向流、SQL、ML、图全面扩张;同门的 Mesos、Alluxio、Ray 各自成为调度、缓存加速与 AI 计算的主力,Databricks 则把这一派做成了商业帝国。

Spark·Mesos·Alluxio·Ray
Delta LakeDatabricks Lakehouse
MLflow · Unity Catalog · Photon

流计算 / Kappa 派STREAM PROCESSING

从 LinkedIn 的 Kafka 开始,数据被重新理解为「无界的事件流」而非「有界的表」。Storm 解决了低延迟,Flink 用 Checkpoint + Watermark 解决了精确一次与乱序,最终确立了流批一体。Kappa 架构主张用一条流管线取代 Lambda 的双链路。

Kafka (LinkedIn)Samza
Storm (Twitter)Heron
Stratosphere (TU Berlin)Flink
Pulsar (Yahoo)·RocketMQ (Alibaba)

MPP / OLAP 派INTERACTIVE ANALYTICS

Hive 的分钟级延迟无法支撑交互式分析,于是出现了大规模并行处理引擎:列存 + 向量化 + 预聚合 + 索引。这一派内部又分成「预计算派」(Druid / Kylin / Pinot)、「列存暴力扫描派」(ClickHouse / Doris / StarRocks)和「联邦查询派」(Presto / Trino / Impala)。

Impala · Drill · PrestoTrino
Druid · Pinot · Kylin(预计算)
ClickHouse (Yandex)·Doris (Baidu)·StarRocks

云原生数仓派CLOUD DATA WAREHOUSE

Snowflake 的核心洞察是把存储与计算彻底解耦:数据放对象存储,计算按需弹性拉起,多个虚拟仓库互不干扰。这一范式击穿了 Teradata / Exadata 的一体机市场,也让 BigQuery、Redshift、MaxCompute、Synapse 全面转向 Serverless 与按量计费。

Snowflake·BigQuery·Redshift
MaxCompute (ODPS)·Synapse → Fabric
核心:存算分离 · 弹性并发 · Serverless

开放表格式 / 湖仓派LAKEHOUSE & TABLE FORMAT

数据湖便宜但没有事务,数仓可靠但封闭且贵。三种开放表格式几乎同时诞生,在对象存储之上补齐 ACID、Schema 演进、时间旅行与 Upsert,让一份数据被多个引擎共享。当前的竞争焦点已从表格式转移到「统一元数据目录」之争。

Hudi (Uber)·Iceberg (Netflix)
Delta Lake (Databricks)·Paimon (Alibaba)
目录之争:Unity · Polaris · Gravitino

现代数据栈派MODERN DATA STACK

SaaS 化、模块化、以 SQL 为中心的组合式方案:托管 EL 工具负责同步,云数仓负责算力,dbt 把数据建模变成带版本、测试和 CI 的软件工程,BI 与语义层负责消费。它催生了「分析工程师」这一新角色,也把 ETL 彻底改成了 ELT。

Fivetran / AirbyteSnowflake / BigQuery
dbtLooker / Metabase
Airflow · Dagster · Great Expectations

中国开源派CHINA OSS LINEAGE

由 BAT、字节、美团、小米与创业公司主导,特点是「场景倒逼」:超大规模实时数仓、金融级分布式事务、低成本流批一体。这一派在 Apache 顶级项目中的占比已相当可观,并且大多有对应的商业公司与云上托管版本。

Doris · StarRocks · Paimon · Kyuubi
SeaTunnel · DolphinScheduler · InLong · Linkis
TiDB · OceanBase · TDengine · NebulaGraph
DataX · Canal · ShardingSphere · Fluss

AI-Native 数据派DATA FOR AI

大模型把数据栈的重心从「结构化指标」推向「非结构化语料 + 向量 + 上下文」。新问题包括:多模态数据如何入湖、向量检索如何与湖仓共存、语义层如何成为 LLM 的可信接口、以及 Agent 如何安全地直接操作数据平台。这是当前最活跃、也最未定型的一派。

Milvus · Qdrant · LanceDB · pgvector
Lance / 多模态湖·Ray Data · Daft
Text2SQL · 语义层 · Data Agent · MCP
02 / 分层图谱

22 层能力,
开源与云一一对位。

按数据流动的顺序自下而上分层。点选上方派系可只看某一阵营,或直接搜索组件名。带 ✕ 标记的为已停止维护或事实退役的项目。

没有匹配的组件,换个关键词试试。
03 / 云上对照

同一个能力,
七朵云各叫什么。

做多云选型或方案迁移时,最费时间的往往不是技术判断,而是术语对齐。这张表按能力层横向对齐了主流云厂商的对应产品。

能力层AWSGoogle CloudAzure / Fabric阿里云腾讯云华为云火山引擎
对象存储S3Cloud StorageADLS Gen2 / OneLakeOSSCOSOBSTOS
数据仓库RedshiftBigQuerySynapse / Fabric WarehouseMaxComputeTCHouse / DLCGaussDB(DWS)ByteHouse
湖仓 / 数据湖Lake Formation · S3 TablesBigLake · DataplexFabric Lakehouse · OneLakeDLF 数据湖构建 · PaimonDLC 数据湖计算LakeFormation · MRS HudiLAS 湖仓一体
Hadoop / Spark 集群EMR · Glue ETLDataprocHDInsight · Synapse SparkEMR · EMR Serverless SparkEMRMRS · DLI SparkEMR
流处理引擎Managed Flink (原 KDA)Dataflow (Beam)Stream Analytics · RTI实时计算 Flink 版 (VVP)流计算 OceanusDLI Flink流式计算 Flink 版
消息 / 事件总线Kinesis · MSK · EventBridgePub/Sub · EventarcEvent Hubs · Event GridKafka 版 · RocketMQ · DataHubCKafka · TDMQDMS Kafka · DISKafka 版 · RocketMQ 版
交互式 OLAPAthena · Redshift ServerlessBigQuery · BI EngineAzure Data Explorer (Kusto)Hologres · AnalyticDBTCHouse-D / -CDLI Presto · CloudTableByteHouse · LAS Presto
数据集成 / CDCGlue · DMS · AppFlowDatastream · Data FusionData Factory · Dataflow Gen2DataWorks 数据集成 · DTSWeData · DTSCDM · DRS · DataArtsDataSail · DataLeap
调度编排MWAA · Step FunctionsCloud Composer · WorkflowsADF Pipelines · Fabric PipelinesDataWorks 调度WeData 调度DataArts 作业编排DataLeap 调度
元数据 / 治理Glue Catalog · DataZoneDataplex Universal CatalogMicrosoft PurviewDataWorks 数据地图 · DataphinWeData 数据资产DataArts CatalogDataLeap 数据地图
数据质量Glue Data QualityDataplex Data QualityPurview Data QualityDataWorks 数据质量WeData 数据质量DataArts QualityDataLeap 数据质量
日志 / 可观测OpenSearch · CloudWatch LogsCloud LoggingLog Analytics · Sentinel日志服务 SLS日志服务 CLS云日志 LTS · CSS日志服务 TLS
NoSQL 宽表DynamoDBBigtable · FirestoreCosmos DBTablestore · LindormTcaplusDB · HBaseGeminiDB · CloudTableveDB · 云 Redis
分布式关系库Aurora · Aurora DSQLSpanner · AlloyDBSQL HyperscalePolarDB · PolarDB-X · OceanBaseTDSQL · TDSQL-CGaussDB · TaurusDBveDB MySQL
向量检索OpenSearch kNN · S3 VectorsVertex AI Vector SearchAzure AI SearchDashVector · Lindorm 向量向量数据库 VectorDBGaussDB 向量 · CSSVikingDB
BI 可视化QuickSightLooker · Looker StudioPower BIQuick BI · DataV腾讯云图 · BIDataArts InsightDataWind
机器学习 / AI 平台SageMaker · BedrockVertex AI · BigQuery MLAzure ML · Azure OpenAIPAI · 百炼 BailianTI-ONE · 混元ModelArts · 盘古veMLP · 火山方舟
数据安全 / 权限Lake Formation · Macie · Clean RoomsIAM · Sensitive Data ProtectionPurview DLP · OneSecurityRAM · SDDP · 数据保护伞CAM · 数据安全中心DSC · DataArts Security数据安全中心
04 / 组合方式

组件不重要,
组合才是方案。

同样的组件池,不同的组合服务于完全不同的目标。以下六套是当下最主流、也最经得起验证的落地组合。

STACK 01

经典离线数仓栈

大多数传统企业自建集群的形态。成本可控、生态成熟,但运维重、时效性只到 T+1,适合已有 IDC 资源且需求以报表为主的场景。

Sqoop / DataXHDFSHive / SparkYARNDolphinSchedulerSuperset
适用:T+1 报表 · 已有机房 · 数据量 TB~PB
风险:组件多、运维成本高、社区活跃度下降
STACK 02

云原生湖仓栈

当前新建平台的主流默认解。数据只存一份在对象存储,用开放表格式加上事务能力,多个引擎按需接入,避免被单一厂商锁定。

OSS / S3Iceberg / PaimonSpark + FlinkTrino / StarRocksAirflow + dbtSuperset
适用:批流统一 · 多引擎共享 · 避免厂商锁定
关键决策:表格式选型与统一元数据目录
STACK 03

实时数仓栈

用 CDC 把业务库变更实时接入,Flink 做流式加工,落到支持 Upsert 的实时 OLAP 引擎,端到端延迟压到秒级,直接支撑实时看板与风控。

Flink CDC / CanalKafkaFlinkPaimon / HudiDoris / StarRocks / Hologres实时看板
适用:实时大屏 · 风控 · 运营监控 · 推荐特征
关键决策:分层是否下沉到 OLAP 引擎内部
STACK 04

现代数据栈(MDS)

几乎不写基础设施代码,把算力和同步全部外包给托管服务,团队把精力集中在建模与指标定义上。人少、迭代快的数据团队效率最高的组合。

Fivetran / AirbyteSnowflake / BigQuerydbtDagsterLooker / MetabaseHightouch 反向 ETL
适用:SaaS 业务 · 小团队 · 快速迭代
风险:SaaS 订阅叠加,成本随数据量非线性增长
STACK 05

日志与可观测栈

面向机器产生的高基数、高吞吐、写多读少的数据。核心矛盾是成本:全量存 ES 太贵,因此近年大量迁往列存或对象存储分层方案。

Vector / Filebeat / OTelKafkaClickHouse / Loki / ESGrafana
适用:日志检索 · 指标监控 · 链路追踪 · 安全审计
关键决策:冷热分层策略与索引粒度
STACK 06

AI / RAG 数据栈

为大模型服务的数据管线。既要处理非结构化语料的切分与向量化,也要给 Agent 提供可信的结构化上下文,语义层与权限控制在这里变得关键。

湖仓 + 文档源Ray / Spark 清洗切分EmbeddingMilvus / pgvector语义层 + MCPLLM Agent
适用:企业知识库 · Text2SQL · Data Agent
关键决策:向量库独立部署还是复用现有数据库