大数据技术,
一张图看懂全貌。
从 Google 三篇论文到 AI-Native 数据栈,二十年间的大数据技术被拆成 22 个能力分层与 10 大技术派系。这里把开源生态与七朵云的对应产品放在同一张图上——不只是罗列名字,而是回答「这一层要解决什么问题、有哪些流派、云上买什么、自建装什么」。
TECH MAP
- 能力分层
- 22 层 · 采集到应用全链路
- 技术派系
- 10 个 · 含中国开源派
- 云厂商
- 7 朵 · 海外 3 + 国内 4
先看谱系,
再看组件。
大数据从来不是一个技术,而是十条互相竞争又互相吸收的技术路线。理解它们从哪来、解决什么问题,比背组件名字有用得多。
Google 三驾马车派THE THREE PAPERS
GFS、MapReduce、BigTable 三篇论文定义了「用廉价机器横向扩展处理海量数据」的范式:分布式存储 + 分布式计算 + 宽表存储。后续二十年的几乎所有系统,都是在回应或推翻这三篇论文。
MapReduce (2004)
BigTable (2006)
Dremel (2010)
Hadoop 传统派THE HADOOP ECOSYSTEM
Yahoo 孵化、Cloudera / Hortonworks / MapR 三家商业化推动的完整生态。以 HDFS + YARN 为底座,用 Hive 把 SQL 翻译成 MapReduce,奠定了「数据湖」和离线数仓的工程范式。缺点是运维重、时延高,2019 年后逐步被云原生方案取代。
Hive · HBase · Pig · Sqoop · Oozie
ZooKeeper · Ambari · Ranger · Atlas
Berkeley AMPLab 派BDAS · SPARK LINEAGE
加州伯克利 AMPLab 提出用内存 RDD 替代 MapReduce 的磁盘 Shuffle,把迭代计算提速一个数量级。Spark 一统批处理,随后向流、SQL、ML、图全面扩张;同门的 Mesos、Alluxio、Ray 各自成为调度、缓存加速与 AI 计算的主力,Databricks 则把这一派做成了商业帝国。
Delta Lake
MLflow · Unity Catalog · Photon
流计算 / Kappa 派STREAM PROCESSING
从 LinkedIn 的 Kafka 开始,数据被重新理解为「无界的事件流」而非「有界的表」。Storm 解决了低延迟,Flink 用 Checkpoint + Watermark 解决了精确一次与乱序,最终确立了流批一体。Kappa 架构主张用一条流管线取代 Lambda 的双链路。
Storm (Twitter)
Stratosphere (TU Berlin)
Pulsar (Yahoo)
MPP / OLAP 派INTERACTIVE ANALYTICS
Hive 的分钟级延迟无法支撑交互式分析,于是出现了大规模并行处理引擎:列存 + 向量化 + 预聚合 + 索引。这一派内部又分成「预计算派」(Druid / Kylin / Pinot)、「列存暴力扫描派」(ClickHouse / Doris / StarRocks)和「联邦查询派」(Presto / Trino / Impala)。
Druid · Pinot · Kylin
ClickHouse (Yandex)
云原生数仓派CLOUD DATA WAREHOUSE
Snowflake 的核心洞察是把存储与计算彻底解耦:数据放对象存储,计算按需弹性拉起,多个虚拟仓库互不干扰。这一范式击穿了 Teradata / Exadata 的一体机市场,也让 BigQuery、Redshift、MaxCompute、Synapse 全面转向 Serverless 与按量计费。
MaxCompute (ODPS)
开放表格式 / 湖仓派LAKEHOUSE & TABLE FORMAT
数据湖便宜但没有事务,数仓可靠但封闭且贵。三种开放表格式几乎同时诞生,在对象存储之上补齐 ACID、Schema 演进、时间旅行与 Upsert,让一份数据被多个引擎共享。当前的竞争焦点已从表格式转移到「统一元数据目录」之争。
Delta Lake (Databricks)
现代数据栈派MODERN DATA STACK
SaaS 化、模块化、以 SQL 为中心的组合式方案:托管 EL 工具负责同步,云数仓负责算力,dbt 把数据建模变成带版本、测试和 CI 的软件工程,BI 与语义层负责消费。它催生了「分析工程师」这一新角色,也把 ETL 彻底改成了 ELT。
Airflow · Dagster · Great Expectations
中国开源派CHINA OSS LINEAGE
由 BAT、字节、美团、小米与创业公司主导,特点是「场景倒逼」:超大规模实时数仓、金融级分布式事务、低成本流批一体。这一派在 Apache 顶级项目中的占比已相当可观,并且大多有对应的商业公司与云上托管版本。
SeaTunnel · DolphinScheduler · InLong · Linkis
TiDB · OceanBase · TDengine · NebulaGraph
DataX · Canal · ShardingSphere · Fluss
AI-Native 数据派DATA FOR AI
大模型把数据栈的重心从「结构化指标」推向「非结构化语料 + 向量 + 上下文」。新问题包括:多模态数据如何入湖、向量检索如何与湖仓共存、语义层如何成为 LLM 的可信接口、以及 Agent 如何安全地直接操作数据平台。这是当前最活跃、也最未定型的一派。
Lance / 多模态湖
Text2SQL · 语义层 · Data Agent · MCP
22 层能力,
开源与云一一对位。
按数据流动的顺序自下而上分层。点选上方派系可只看某一阵营,或直接搜索组件名。带 ✕ 标记的为已停止维护或事实退役的项目。
同一个能力,
七朵云各叫什么。
做多云选型或方案迁移时,最费时间的往往不是技术判断,而是术语对齐。这张表按能力层横向对齐了主流云厂商的对应产品。
| 能力层 | AWS | Google Cloud | Azure / Fabric | 阿里云 | 腾讯云 | 华为云 | 火山引擎 |
|---|---|---|---|---|---|---|---|
| 对象存储 | S3 | Cloud Storage | ADLS Gen2 / OneLake | OSS | COS | OBS | TOS |
| 数据仓库 | Redshift | BigQuery | Synapse / Fabric Warehouse | MaxCompute | TCHouse / DLC | GaussDB(DWS) | ByteHouse |
| 湖仓 / 数据湖 | Lake Formation · S3 Tables | BigLake · Dataplex | Fabric Lakehouse · OneLake | DLF 数据湖构建 · Paimon | DLC 数据湖计算 | LakeFormation · MRS Hudi | LAS 湖仓一体 |
| Hadoop / Spark 集群 | EMR · Glue ETL | Dataproc | HDInsight · Synapse Spark | EMR · EMR Serverless Spark | EMR | MRS · DLI Spark | EMR |
| 流处理引擎 | Managed Flink (原 KDA) | Dataflow (Beam) | Stream Analytics · RTI | 实时计算 Flink 版 (VVP) | 流计算 Oceanus | DLI Flink | 流式计算 Flink 版 |
| 消息 / 事件总线 | Kinesis · MSK · EventBridge | Pub/Sub · Eventarc | Event Hubs · Event Grid | Kafka 版 · RocketMQ · DataHub | CKafka · TDMQ | DMS Kafka · DIS | Kafka 版 · RocketMQ 版 |
| 交互式 OLAP | Athena · Redshift Serverless | BigQuery · BI Engine | Azure Data Explorer (Kusto) | Hologres · AnalyticDB | TCHouse-D / -C | DLI Presto · CloudTable | ByteHouse · LAS Presto |
| 数据集成 / CDC | Glue · DMS · AppFlow | Datastream · Data Fusion | Data Factory · Dataflow Gen2 | DataWorks 数据集成 · DTS | WeData · DTS | CDM · DRS · DataArts | DataSail · DataLeap |
| 调度编排 | MWAA · Step Functions | Cloud Composer · Workflows | ADF Pipelines · Fabric Pipelines | DataWorks 调度 | WeData 调度 | DataArts 作业编排 | DataLeap 调度 |
| 元数据 / 治理 | Glue Catalog · DataZone | Dataplex Universal Catalog | Microsoft Purview | DataWorks 数据地图 · Dataphin | WeData 数据资产 | DataArts Catalog | DataLeap 数据地图 |
| 数据质量 | Glue Data Quality | Dataplex Data Quality | Purview Data Quality | DataWorks 数据质量 | WeData 数据质量 | DataArts Quality | DataLeap 数据质量 |
| 日志 / 可观测 | OpenSearch · CloudWatch Logs | Cloud Logging | Log Analytics · Sentinel | 日志服务 SLS | 日志服务 CLS | 云日志 LTS · CSS | 日志服务 TLS |
| NoSQL 宽表 | DynamoDB | Bigtable · Firestore | Cosmos DB | Tablestore · Lindorm | TcaplusDB · HBase | GeminiDB · CloudTable | veDB · 云 Redis |
| 分布式关系库 | Aurora · Aurora DSQL | Spanner · AlloyDB | SQL Hyperscale | PolarDB · PolarDB-X · OceanBase | TDSQL · TDSQL-C | GaussDB · TaurusDB | veDB MySQL |
| 向量检索 | OpenSearch kNN · S3 Vectors | Vertex AI Vector Search | Azure AI Search | DashVector · Lindorm 向量 | 向量数据库 VectorDB | GaussDB 向量 · CSS | VikingDB |
| BI 可视化 | QuickSight | Looker · Looker Studio | Power BI | Quick BI · DataV | 腾讯云图 · BI | DataArts Insight | DataWind |
| 机器学习 / AI 平台 | SageMaker · Bedrock | Vertex AI · BigQuery ML | Azure ML · Azure OpenAI | PAI · 百炼 Bailian | TI-ONE · 混元 | ModelArts · 盘古 | veMLP · 火山方舟 |
| 数据安全 / 权限 | Lake Formation · Macie · Clean Rooms | IAM · Sensitive Data Protection | Purview DLP · OneSecurity | RAM · SDDP · 数据保护伞 | CAM · 数据安全中心 | DSC · DataArts Security | 数据安全中心 |
组件不重要,
组合才是方案。
同样的组件池,不同的组合服务于完全不同的目标。以下六套是当下最主流、也最经得起验证的落地组合。
经典离线数仓栈
大多数传统企业自建集群的形态。成本可控、生态成熟,但运维重、时效性只到 T+1,适合已有 IDC 资源且需求以报表为主的场景。
风险:组件多、运维成本高、社区活跃度下降
云原生湖仓栈
当前新建平台的主流默认解。数据只存一份在对象存储,用开放表格式加上事务能力,多个引擎按需接入,避免被单一厂商锁定。
关键决策:表格式选型与统一元数据目录
实时数仓栈
用 CDC 把业务库变更实时接入,Flink 做流式加工,落到支持 Upsert 的实时 OLAP 引擎,端到端延迟压到秒级,直接支撑实时看板与风控。
关键决策:分层是否下沉到 OLAP 引擎内部
现代数据栈(MDS)
几乎不写基础设施代码,把算力和同步全部外包给托管服务,团队把精力集中在建模与指标定义上。人少、迭代快的数据团队效率最高的组合。
风险:SaaS 订阅叠加,成本随数据量非线性增长
日志与可观测栈
面向机器产生的高基数、高吞吐、写多读少的数据。核心矛盾是成本:全量存 ES 太贵,因此近年大量迁往列存或对象存储分层方案。
关键决策:冷热分层策略与索引粒度
AI / RAG 数据栈
为大模型服务的数据管线。既要处理非结构化语料的切分与向量化,也要给 Agent 提供可信的结构化上下文,语义层与权限控制在这里变得关键。
关键决策:向量库独立部署还是复用现有数据库