本文把大数据平台的发展概括为六个阶段。这不是一个行业正式标准,也不是严格按年份切割的产品版本史,而是一套用于理解架构演进的分析模型。

大数据平台并不是沿着一条“新产品彻底淘汰旧产品”的直线演进。更准确的过程是:

1
2
3
4
5
6
7
8
9
上一阶段解决了当时最突出的矛盾
             ↓
规模、性能或使用范围扩大
             ↓
原有架构暴露出新的问题
             ↓
增加新的抽象层或基础设施
             ↓
形成下一阶段

因此,HDFS、Hive、Spark、Flink、Kubernetes、Iceberg、Paimon 和 Ray 并不处于同一个竞争层次。它们分别解决存储、计算、资源运行、数据管理和 AI 计算等不同问题,今天仍可能同时出现在一套平台中

本文分为两部分:

  1. 大数据平台六阶段演进:每个阶段解决什么问题、代表性的开源与商业产品是什么,以及它又带来了哪些新问题
  2. 新建现代大数据平台的方法:为什么应以 Kubernetes 为默认 Resource Runtime,如何收敛存储组件,以及怎样补齐计算、数据采集、消息传输、工作流、安全、可观测性和平台交付能力