一、半导体基础与芯片设计

半导体基础总览:从导体、半导体和绝缘体的区别出发,理解硅材料、掺杂、PN 结、MOS 管及数字逻辑之间的关系。

半导体基础总览

从电子到晶体管再到芯片:沿着电子运动、开关器件、逻辑门、寄存器和处理器的层级,理解芯片如何完成计算。

从电子到晶体管再到芯片

MOSFET 工作原理:通过栅极电压控制沟道的形成与关闭,并用截止、线性和饱和三个区域描述其工作状态。

MOSFET 工作原理

CMOS 结构与低功耗原理:利用 nMOS 与 pMOS 互补导通,使电路主要在状态切换时产生动态功耗。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
半导体材料
   ↓
MOSFET
   ↓
pMOS + nMOS
   ↓
CMOS 电路
   ↓
NOT / NAND / NOR
   ↓
AND / OR / XOR
   ↓
加法器
   ↓
ALU
   ↓
CPU / GPU

CMOS 结构与低功耗原理

晶体管组成逻辑门:通过不同的串并联组合构造 NOT、NAND、NOR、AND、OR 和 XOR,并进一步搭建时序与计算电路。

1
2
3
4
5
6
7
8
9
# AND 实现
A ──┐
    NAND ── X ── NOT ── OUTPUT
B ──┘

# OR 实现
A ──┐
    NOR ── X ── NOT ── OUTPUT
B ──┘

XOR 实现

1
2
3
4
5
6
7
8
# 普通实现
A ─────────┐
           AND ─────┐
B ── NOT ──┘        │
                    OR ── XOR
A ── NOT ──┐        │
           AND ─────┘
B ─────────┘

优化后的 xor

flowchart LR
    A[A] --> N1["NAND<br/>X = ~(A·B)"]
    B[B] --> N1

    A --> N2["NAND<br/>P = ~(A·X)"]
    N1 --> N2

    B --> N3["NAND<br/>Q = ~(B·X)"]
    N1 --> N3

    N2 --> N4["NAND<br/>Y = ~(P·Q)"]
    N3 --> N4

    N4 --> Y["XOR 输出 Y"]

按最经典的静态 CMOS 实现来数

  • 1 个 pMOS = 1 个晶体管
  • 1 个 nMOS = 1 个晶体管
逻辑门 典型 CMOS 晶体管数
NOT 2
NAND 4
NOR 4
AND 6
OR 6

半加器

1
2
3
4
5
6
7
A ─────┬────→ XOR ───→ Sum
       │
B ─────┘

A ─────┬────→ AND ───→ Carry
       │
B ─────┘

全加器

  • SUM:当前这一位的计算结果
  • COUT:向更高一位产生的进位。
flowchart LR
    A[A] --> XOR1[XOR]
    B[B] --> XOR1
    XOR1 -->|X = A XOR B| XOR2[XOR]
    Cin[Cin] --> XOR2
    XOR2 --> SUM[SUM]

    A --> AND1[AND]
    B --> AND1
    AND1 -->|C1 = A AND B| OR1[OR]

    XOR1 --> AND2[AND]
    Cin --> AND2
    AND2 -->|C2 = X AND Cin| OR1

    OR1 --> COUT[COUT]

再把很多个全加器串起来,就能算多位二进制:

1
2
3
4
5
6
7
8
bit 0       bit 1       bit 2       bit 3

A0,B0       A1,B1       A2,B2       A3,B3
  ↓           ↓           ↓           ↓
[全加器] → [全加器] → [全加器] → [全加器]
   │ Cin/Cout   │           │
   ↓            ↓           ↓
  S0           S1          S2          S3

晶体管组成逻辑门

芯片设计流程:从需求规格、架构设计和 RTL 编码,经过验证、综合、布局布线与签核,最终生成 Tape-out 数据。

芯片设计流程

CPU、GPU 与 TPU 架构对比:CPU 擅长通用控制,GPU 强于大规模并行,而 TPU 面向矩阵计算进行专用优化。

CPU GPU TPU 架构对比

AI 计算的本质:神经网络训练与推理可以归结为大量矩阵乘加,以及围绕算力、显存带宽和数据搬运的协同优化。

AI 计算的本质

二、晶圆制造与光刻

从沙子到晶圆:高纯石英经过提纯、拉晶、切片、研磨和清洗,最终形成满足芯片制造要求的单晶硅片。

从沙子到晶圆

晶圆制造总流程:芯片通过 FEOL、MOL 与 BEOL 中反复进行薄膜、光刻、刻蚀、注入和互连,逐层构建完整电路。

晶圆制造总流程

图形转移循环:涂胶、曝光、显影、刻蚀或注入、去胶等步骤不断重复,把掩膜版图形逐层复制到晶圆上。

图形转移循环机制

关键制造工艺:沉积、离子注入、刻蚀、CMP 和金属互连分别负责堆叠材料、改变电性、塑造结构、表面平坦化与连接器件。

芯片关键制造工艺

芯片剖面、良率与测试:从多层互连结构观察芯片实体,并通过晶圆测试、切割、封装和成品测试筛选合格芯片。

芯片剖面良率与测试

光刻机总览:光源经照明、掩膜、投影物镜和晶圆台完成图形曝光,其精度取决于光学、机械与控制系统的协同。

光刻机总览

DUV 与 EUV 对比:更短波长的 EUV 能获得更高分辨率并减少多重曝光,但设备、光源、真空环境和掩膜体系更复杂。

DUV 与 EUV 对比

EUV 光源与镜面系统:激光轰击锡滴产生 13.5 纳米极紫外光,再由多层反射镜收集、整形并投射到晶圆。

EUV 光源与镜面系统

光刻为何困难:分辨率、套刻精度、焦深、热漂移、颗粒污染和随机缺陷相互制约,共同决定光刻良率和成本。

光刻为什么这么难

三、先进制程与先进封装

先进制程与摩尔定律:制程节点持续缩小带来更高密度和更低功耗,同时也推高设备、研发、掩膜和晶圆制造成本。

先进制程节点与摩尔定律

平面晶体管到 FinFET 再到 GAA:栅极对沟道的包围程度不断提高,以改善短沟道效应、漏电和静电控制能力。

平面晶体管 FinFET GAA

先进制程挑战总览:量子效应、互连延迟、功耗密度、工艺复杂度与巨额成本,让节点演进成为系统工程。

先进制程挑战总览

传统封装到先进封装:封装从保护裸片和引出信号,演进为提升互连密度、带宽、散热与系统集成度的关键技术。

传统封装到先进封装

Chiplet 与先进封装:将大型单片芯片拆成多个功能小芯粒,再通过 2.5D、3D 和高速互连组合成完整系统。

Chiplet 与先进封装

HBM 结构与工作原理:多层 DRAM 通过 TSV 垂直堆叠并采用超宽接口,为 AI 加速器提供高带宽、低功耗的近端内存。

HBM 结构与工作原理

GPU、HBM、Interposer 与 CoWoS:中介层把计算芯片与多组 HBM 高密度互连,再由先进封装完成供电、散热和外部连接。

GPU HBM Interposer CoWoS

四、AI 芯片与服务器系统

AI 芯片全景:CPU、GPU、TPU 或 NPU、HBM、存储、网络和高速互连共同构成完整的 AI 计算平台。

AI 芯片全景

AI 服务器内部结构:多颗 GPU 通过 NVLink 或高速交换网络互连,并与 CPU、内存、存储和网卡协同支撑训练与推理。

AI 服务器内部结构

AI 训练时的数据流:数据经过加载与预处理进入 GPU,完成前向计算、反向传播、梯度同步和参数更新,并循环直至收敛。

AI 训练时的数据流

从晶体管到 AI 服务器:材料、器件、芯片设计、晶圆制造、先进封装和系统互连层层协作,最终形成可用的 AI 算力基础设施。

从晶体管到 AI 服务器