Chapter 07

HBM과 3D 적층

최신 AI 가속기 한 개는 초당 8 TB 이상의 데이터를 메모리에서 읽는다. 이 대역폭은 PCB 위의 메모리 칩으로는 낼 수 없다. HBM(High Bandwidth Memory)은 DRAM 다이 여러 장을 수직으로 쌓아 수천 개의 TSV로 꿰뚫고, 실리콘 인터포저 위 GPU 바로 옆에 붙여 1024~2048비트의 넓은 버스로 연결한다. 이 장에서는 HBM 패키지를 3D로 분해해 보고, 대역폭·에너지·공정·열·수율이라는 다섯 개의 렌즈로 이 구조가 왜 이렇게 생겼는지 따져 본다.

왜 HBM인가: 넓고 느린 버스

1장에서 본 메모리 월(Memory Wall)은 AI 시대에 가장 극적으로 드러났다. 대규모 언어 모델(LLM)이 토큰 하나를 생성하려면 수십~수백 GB의 가중치를 한 번씩 읽어야 하고, 이때 연산 유닛은 대부분 데이터를 기다린다. 가속기의 성능이 연산 능력(FLOPS)보다 메모리 대역폭에 묶이는 것이다(13장의 루프라인 모델).

대역폭을 올리는 방법은 두 가지뿐이다. 선 하나를 더 빨리 흔들거나, 선을 더 많이 까는 것이다.

$$\text{BW} = \frac{N_\text{DQ} \times f_\text{pin}}{8}\quad[\text{B/s}]$$
여기서 \(N_\text{DQ}\)는 데이터 핀(비트선) 수, \(f_\text{pin}\)은 핀당 전송 속도(Gb/s)다. 8로 나누어 바이트 단위로 바꾼다. 예: GDDR7 칩 1개는 32비트 × 32 Gb/s ÷ 8 = 128 GB/s, HBM3E 스택 1개는 1024비트 × 9.6 Gb/s ÷ 8 ≈ 1.23 TB/s.

6장의 GDDR은 첫 번째 길을 끝까지 밀어붙인 메모리다. 칩당 32비트밖에 안 되지만 핀 하나를 20~32 Gb/s로 흔든다(GDDR7은 PAM3 신호). 대신 수 cm 길이의 PCB 배선에서 반사·누화·손실을 이겨 내려면 강한 드라이버, 종단 저항, 이퀄라이저, 정교한 트레이닝이 필요하고, 비트당 에너지가 커진다. 게다가 GPU 둘레에 놓을 수 있는 칩 수는 기껏 8~16개라 총 대역폭은 약 2 TB/s 근처에서 막힌다.

HBM은 두 번째 길을 택했다. 핀 속도는 GDDR의 1/3 수준(HBM3E 약 9.6 Gb/s)으로 낮추는 대신, 스택 하나에 1024개(HBM4는 2048개)의 데이터선을 깐다. PCB로는 불가능한 숫자지만, 실리콘 인터포저 위에서는 선폭 1 µm 안팎의 배선을 수 mm만 그으면 된다. 선이 짧고 가늘어 커패시턴스가 작으니 약한 드라이버로 충분하고, 종단도 필요 없다.

GDDR: 좁고 빠른 버스 HBM: 넓고 느린 버스 PCB GPU GDDRGDDRGDDRGDDR 32 bit 32 Gb/s 배선 수 cm · 종단·EQ 필요 패키지 기판 실리콘 인터포저 HBM 스택 GPU 1024 가닥 수 mm 칩당 32 bit × 32 Gb/s ≈ 128 GB/s 빠른 핀 소수 · 비트당 에너지 큼 스택당 1024 bit × 9.6 Gb/s ≈ 1.2 TB/s 느린 핀 다수 · 짧고 가는 배선 · 비트당 에너지 작음
그림 7-1. 두 가지 대역폭 전략. GDDR은 PCB 위의 칩 몇 개를 빠른 신호로 연결하고, HBM은 실리콘 인터포저 위에서 수천 가닥의 짧은 배선으로 연결한다(개략도, 배선은 일부만 표시).

에너지 측면에서 보면 차이는 더 분명하다. 데이터 전송 전력은 대역폭과 비트당 에너지의 곱이다.

$$P_\text{mem} = \text{BW}_\text{bit} \times E_\text{bit}, \qquad E_\text{bit} \approx \alpha\, C_\text{line} V_\text{swing} V_\text{DD} + E_\text{core}$$
\(\text{BW}_\text{bit}\)는 초당 비트 수, \(E_\text{bit}\)는 비트 하나를 옮기는 에너지(pJ/bit)다. 선의 커패시턴스 \(C_\text{line}\)이 작을수록, 신호 스윙이 작을수록 I/O 에너지가 줄어든다. \(E_\text{core}\)는 셀 어레이 활성화·센싱 등 DRAM 내부 에너지다.

대략적인 값으로 HBM3/3E는 코어와 I/O를 합쳐 약 3~5 pJ/bit, GDDR6/7은 약 6~8 pJ/bit 수준으로 알려져 있다(조건에 따라 편차가 크다). 8 TB/s를 GDDR급 에너지로 옮기면 메모리 전력만 400 W를 넘긴다. HBM이 “AI 가속기의 메모리”가 된 것은 대역폭과 전력, 두 벽을 동시에 낮췄기 때문이다.

대역폭 밀도라는 관점

칩 설계자는 “다이 가장자리 1 mm당 몇 GB/s를 뽑을 수 있는가”를 따진다. 이를 쇼어라인 대역폭 밀도(Shoreline Bandwidth Density)라 한다. GPU 다이의 둘레는 유한하고, 그 둘레에 PHY를 늘어놓아야 한다. HBM PHY는 마이크로범프 피치로 신호를 촘촘히 빼내므로 같은 가장자리 길이에서 PCB용 PHY보다 훨씬 많은 대역폭을 낸다. 가속기 한 개에 HBM 스택을 6~8개 이상 붙이는 이유다.

HBM 패키지의 구조

HBM 패키지를 아래에서 위로 올라가며 살펴보자. 가장 아래는 유기 재료로 만든 패키지 기판(Package Substrate)으로, 1 mm 안팎 피치의 BGA 볼로 메인보드와 연결된다. 그 위에 C4 범프(피치 약 130~150 µm)로 실리콘 인터포저(Silicon Interposer)가 올라간다. 인터포저는 트랜지스터가 없는 얇은 실리콘 판(약 100 µm)으로, 윗면의 미세 배선층(RDL)이 GPU와 HBM을 잇고, 내부의 TSV가 전원과 외부 신호를 아래 기판으로 내려보낸다. GPU와 HBM을 한 인터포저 위에 나란히 놓는 이 방식을 2.5D 패키징이라 하고, TSMC의 CoWoS(Chip-on-Wafer-on-Substrate)가 대표적이다.

↑ 방열: TIM · 리드(히트 스프레더) · 히트싱크 GPU / SoC 다이 높이를 HBM 스택과 맞춘다 (~0.7–0.8 mm) 패키지 기판 (유기 빌드업, ~1–2 mm) 코어 DRAM 다이×8 (각 ~30–50 µm) 마이크로범프(피치 ~40 µm 전후) 베이스(로직) 다이 실리콘 인터포저(TSV + RDL) C4 범프 BGA 볼 (~1 mm 피치) TSV 다발 (지름 ~5–10 µm)
그림 7-2. 2.5D HBM 패키지의 단면(개략도, 두께 과장). HBM 스택은 베이스 다이 위에 코어 DRAM 다이를 쌓고 TSV와 마이크로범프로 수직 연결한다. 스택과 GPU는 인터포저 윗면의 RDL 배선으로 수 mm 거리에서 연결되고, 인터포저 TSV와 C4 범프가 전원·외부 신호를 기판으로 내린다.

HBM 스택 자체는 두 종류의 다이로 이루어진다.

TSV(Through-Silicon Via)는 실리콘을 수직으로 뚫고 구리로 채운 기둥이다. 지름은 약 5~10 µm, 깊이는 박화된 다이 두께와 같은 약 30~50 µm이다. 다이와 다이 사이는 구리 필러 끝에 솔더를 올린 마이크로범프(Micro-bump)로 붙이는데, 피치는 수십 µm(약 40 µm 전후), 높이는 10~20 µm 정도다. 범프 사이의 빈틈은 언더필 재료로 메워 기계적 강도와 열전도를 확보한다.

위 다이 (뒤집힌 방향 아님: 전면이 아래) 언더필 (NCF / MUF) 더미(열) 범프 TSV 없음 30–50 µm 범프 피치 ~40 µm 전후 높이 10–20 µm TSV 지름 ~5–10 µm 구리 (TSV · 필러) 솔더 캡 (SnAg) 후면 패드 (Ni/Au 등) SiO₂ 라이너 · 배리어 BEOL 배선층 (전면) 언더필 TSV 수: 스택당 수천 개 이상 (데이터·주소·클록·전원·접지·여분) 종횡비 약 5:1 ~ 10:1
그림 7-3. 두 코어 다이 사이의 TSV와 마이크로범프 확대(개략도). 위 다이의 TSV 아래쪽 구리 필러가 솔더로 아래 다이의 후면 패드에 붙는다. 전기 신호가 없는 더미 범프는 열 전달과 기계적 지지를 위해 추가한다.

TSV 한 개는 산화막 라이너를 유전체로 한 동축 커패시터로 볼 수 있다. 커패시턴스를 어림해 보면 PCB 배선이나 본딩 와이어보다 훨씬 작다는 것을 알 수 있다.

$$C_\text{TSV} \approx \frac{2\pi \varepsilon_\text{ox} L}{\ln\!\left(r_\text{ox}/r\right)}$$
\(L\)은 TSV 길이, \(r\)은 구리 반지름, \(r_\text{ox}\)는 라이너 바깥 반지름이다. \(r = 2.5\) µm, 라이너 0.5 µm, \(L = 50\) µm이면 \(C \approx 2\pi (3.9)(8.85\times10^{-12})(50\times10^{-6}) / \ln(3/2.5) \approx 60\) fF. 실제로는 주변 실리콘의 공핍층 때문에 이보다 조금 작다. PCB 배선 수 cm는 수 pF이므로 두 자릿수 차이다.
왜 GPU 위에 바로 쌓지 않을까? (2.5D vs 3D)

DRAM을 GPU 다이 위에 직접 올리면(진정한 3D) 배선은 더 짧아진다. 하지만 수백 W를 내는 GPU 위에 온도에 민감한 DRAM(5장의 리프레시 주기는 85 °C를 넘으면 절반으로 줄어든다)을 얹으면 열이 치명적이고, GPU 쪽 방열 경로도 막힌다. 그래서 현재는 옆에 놓는 2.5D가 표준이다. 인터포저 크기가 레티클 한계(약 26×33 mm)를 넘어서면서 TSMC는 여러 레티클을 이어 붙인 대형 인터포저(CoWoS-S), 작은 실리콘 브리지를 유기 기판에 박은 CoWoS-L 등으로 확장하고 있다.

3D로 보는 HBM 패키지

아래 모델은 GPU 다이 하나와 HBM 스택 네 개가 실리콘 인터포저 위에 놓인 패키지다. 가로 크기는 실제 비율에 가깝고(GPU ≈ 26×32 mm, HBM ≈ 11×10 mm), 두께 방향은 약 4배 과장했다. 적층 수를 바꾸면 스택 높이 한도 안에 다이를 끼워 넣기 위해 코어 다이가 얼마나 얇아져야 하는지가 계산된다. 분해도를 올려 층을 벌리고, 스택 확대로 앞쪽 스택에 다가가 TSV 기둥과 마이크로범프를 확인해 보자. 청록색 점은 GPU에서 코어 다이로 가는 쓰기 데이터, 주황색 점은 코어 다이에서 GPU로 돌아오는 읽기 데이터다.

3D

2.5D HBM 패키지 분해 모델

드래그 회전 · 휠/핀치 확대
적층 수
세대
다이 간 접합
보기
스택 용량 (24 Gb 다이)—
코어 다이 허용 두께—
스택 대역폭—
모형 전체 (4스택)—
해볼 것: ① HBM3E에서 4-Hi → 16-Hi로 올리며 “코어 다이 허용 두께”가 어떻게 줄어드는지 보자. 16-Hi에서는 20 µm대까지 내려가 웨이퍼 취급이 매우 어려워진다. ② 세대를 HBM4로 바꾸면 높이 한도가 720 → 775 µm로 늘고, 베이스 다이 색이 로직 공정(금색)으로 바뀌며, 버스가 2048비트가 된다. ③ “하이브리드 본딩”을 고르면 범프와 빈틈이 사라져 같은 높이에 더 두꺼운 다이를 쓸 수 있다. (두께 계산: 한도 − 베이스 60 µm − 상부 여유 40 µm − 계면 N×(범프 15 µm 또는 하이브리드 1 µm), 교육용 가정.)

모델에서 GPU 다이와 HBM 스택의 윗면 높이가 거의 같다는 점을 눈여겨보자. 둘 위에 하나의 리드(히트 스프레더)와 히트싱크가 얹히므로, 높이가 어긋나면 TIM 두께가 달라져 방열이 나빠진다. JEDEC이 HBM3E까지 스택 높이를 720 µm로 묶어 둔 이유다. 16-Hi를 품어야 하는 HBM4에서는 이를 775 µm로 완화했다(GPU 웨이퍼의 표준 두께와 같은 값이다).

채널과 의사 채널: 1024비트를 나누어 쓰기

1024비트 버스를 하나의 거대한 메모리처럼 쓰면 곤란하다. 접근 한 번에 1024비트 × 버스트 길이만큼의 데이터가 오가므로, GPU가 원하는 작은 데이터(캐시 라인 32~128 B)에 비해 너무 크다. 그래서 HBM은 버스를 여러 개의 독립 채널(Channel)로 나눈다. 각 채널은 자기만의 명령·주소 버스와 뱅크를 가지고 서로 다른 타이밍으로 동작한다. 사실상 스택 하나가 작은 DRAM 수십 개인 셈이다.

HBM3 스택: 1024 DQ CH0CH1CH2CH3 CH4…………………………CH15 16 채널 × 64 DQ (각자 명령·주소 버스) PC0 · 32 DQ 의사 채널 0 PC1 · 32 DQ 의사 채널 1 각 의사 채널은 자기 뱅크 그룹·뱅크를 가짐 (그림은 일부) 한 번의 접근 = 32 B HBM3: 32 DQ × BL8 = 256 bit = 32 B HBM2: 64 DQ × BL4 = 32 B (의사 채널 모드) 두 PC는 채널의 명령 버스를 공유하지만 뱅크와 데이터 버스는 따로 → 반독립 동작 HBM4: 32 채널 × 64 DQ = 2048 DQ (채널당 의사 채널 2개 → 64 PC)
그림 7-4. HBM3 스택의 논리 구조. 1024비트를 16개 채널(64비트)로 나누고, 각 채널을 다시 32비트 의사 채널 두 개로 쪼갠다. 접근 단위(32 B)가 GPU 캐시 섹터 크기와 맞아 작은 요청도 낭비 없이 처리한다.

의사 채널(Pseudo Channel, PC)은 HBM2에서 도입되었다. 채널 하나의 128비트 데이터 버스를 64비트 두 개로 나누고, 명령·주소 버스는 공유하되 뱅크와 데이터선은 따로 쓰게 한 것이다. 한 번의 접근 크기가 절반으로 줄어 작은 무작위 접근의 효율이 올라가고, 두 PC가 번갈아 동작하면서 5장에서 본 tFAW·tRRD 같은 뱅크 제약을 분산시킨다. HBM3는 채널을 16개(64비트)로 늘리고 PC를 32비트로 줄였으며, HBM4는 채널 수를 다시 두 배(32채널, 64 PC)로 늘려 2048비트가 되었다.

채널 수가 곧 병렬성이다

GPU의 메모리 컨트롤러는 수천 개의 스레드가 쏟아내는 요청을 채널별 큐에 나누어 담는다. HBM3E 스택 8개면 의사 채널이 8 × 32 = 256개, HBM4 스택 8개면 512개다. 이 많은 독립 경로가 동시에 로우 버퍼를 열고 닫으며 대역폭을 끌어낸다. 채널이 많을수록 뱅크 충돌 확률이 낮아지고, 무작위에 가까운 AI 워크로드에서도 실효 대역폭이 피크에 가까워진다.

세대별 진화: HBM에서 HBM4까지

HBM은 SK hynix와 AMD가 공동 개발해 2013년 JEDEC 표준(JESD235)이 되었고, 2015년 AMD Radeon R9 Fury X에 처음 탑재되었다. 이후 세대마다 핀 속도를 대략 두 배씩 올렸고, HBM4에서는 처음으로 버스 폭 자체를 두 배로 넓혔다.

세대표준/양산버스 폭핀 속도 (Gb/s)스택 대역폭적층 · 용량높이 한도대표 제품
HBM2013 / 201510241.0128 GB/s4-Hi · 1 GB720 µmAMD Fury X
HBM2201610242.0–2.4256–307 GB/s4/8-Hi · 4–8 GB720 µmNVIDIA P100, V100
HBM2E2019–202010243.2–3.6410–460 GB/s4/8-Hi · 8–16 GB720 µmNVIDIA A100
HBM3202210246.4819 GB/s8/12-Hi · 16–24 GB720 µmNVIDIA H100, AMD MI300X
HBM3E202410248–9.8~1.0–1.25 TB/s8/12-Hi · 24–36 GB720 µmH200, B200/B300, MI325X/MI355X
HBM42025 표준 / 2026 본격 양산20488 (규격) · 약 10+ (제품)~2.0–2.8 TB/s4–16-Hi · 24–64 GB775 µmNVIDIA Rubin (2026)

표의 수치는 대표값이다. 같은 세대라도 제조사·제품마다 핀 속도가 다르고, HBM3E와 HBM4의 최고 속도는 해마다 올라가고 있다(2025~2026년 기준). 용량은 코어 다이 밀도 × 적층 수로 정해진다. 예를 들어 24 Gb(3 GB) 다이를 12장 쌓으면 36 GB, 32 Gb 다이를 16장 쌓으면 64 GB다.

$$C_\text{stack} = N_\text{Hi} \times D_\text{die}, \qquad \text{BW}_\text{stack} = \frac{W_\text{bus}\, f_\text{pin}}{8}$$
\(N_\text{Hi}\)는 코어 다이 수, \(D_\text{die}\)는 다이 밀도(Gb → GB는 ÷8), \(W_\text{bus}\)는 스택의 데이터 버스 폭(1024 또는 2048)이다. 대역폭은 적층 수와 무관하다는 점에 주의하자. 다이를 더 쌓으면 용량은 늘지만, 같은 채널들을 여러 다이가 나누어 쓸 뿐이다.
SIMULATOR

HBM 대역폭 계산기와 메모리 비교

세대 (버스 폭)
스택 대역폭—
총 대역폭—
총 데이터 핀—
메모리 전력 (추정)—
해볼 것: ① HBM3E 9.6 Gb/s × 8스택이 GDDR7 512비트(RTX 5090급)의 몇 배인지 보자. ② 아래 그래프에서 같은 대역폭을 GDDR7으로 내려면 칩이 몇 개 필요한지 확인하자. 핀 수는 오히려 GDDR이 적지만, GPU 둘레에 수십 개의 칩을 수 cm 배선으로 붙이는 것은 물리적으로 불가능하다. ③ HBM4를 고르면 버스가 2048비트가 되어 같은 핀 속도에서 대역폭이 두 배가 된다. (비트당 에너지는 교육용 대략값: HBM2E 4.5, HBM3 4, HBM3E 3.5, HBM4 3, GDDR7 6.5, LPDDR5X 4.5, DDR5 9 pJ/bit. 실제로는 조건에 따라 ±50% 이상 달라진다.)
“핀이 많다”는 것의 진짜 비용

HBM은 GDDR보다 핀(데이터선)이 훨씬 많다. 이 선들이 싼 것은 PCB가 아니라 실리콘 인터포저 위에 있기 때문이다. 대신 그 대가로 인터포저·CoWoS라는 비싼 첨단 패키지 공정이 필요하고, 한동안 AI 가속기 공급의 병목은 GPU 다이가 아니라 CoWoS 생산 능력이었다. HBM의 비트당 가격도 일반 DRAM의 수 배 수준이다. HBM은 “대역폭과 에너지가 가격보다 중요한” 곳에서만 쓰인다.

적층 공정: TSV, 박화, 본딩

HBM 코어 다이는 일반 DRAM 웨이퍼 공정에 몇 가지 단계를 더해 만든다. 핵심은 TSV를 언제 뚫느냐다. 트랜지스터(FEOL)를 만든 뒤, 배선(BEOL)을 만들기 전에 TSV를 형성하는 방식을 비아 미들(Via-middle)이라 하며 HBM의 주류다. 트랜지스터 공정의 고온을 피하면서 배선층과 자연스럽게 연결할 수 있기 때문이다.

전면 공정 (두꺼운 웨이퍼 ~775 µm 상태) ① FEOL셀 트랜지스터·커패시터 ② TSV 식각DRIE(보쉬 공정), 깊이 ~50 µm ③ 라이너 · Cu 충전SiO₂/배리어/시드 → 전기도금 ④ CMP · BEOL배선층 · 전면 범프(필러) ⑤ 캐리어 접착전면을 임시 접착제로 고정 ⑥ 박화후면 그라인딩 → ~30–50 µm ⑦ TSV 노출식각·절연막·후면 패드 ⑧ 분리 · 테스트디본딩·다이싱 → KGD → 적층 PASSFAIL 후면 공정 (얇은 웨이퍼는 캐리어 없이는 휘고 깨진다)
그림 7-5. 비아 미들 TSV 공정 흐름(개략). 전면에서 TSV를 뚫고 채운 뒤 배선을 만들고, 웨이퍼를 캐리어에 붙여 후면을 수십 µm까지 갈아 내 TSV 끝을 드러낸다. 분리된 다이는 테스트를 거쳐 양품(KGD)만 적층된다.

박화된 다이는 A4 용지보다 얇다(약 30~50 µm, 종이는 약 100 µm). 이렇게 얇은 실리콘은 쉽게 휘고, 열을 받으면 뒤틀린다(워피지). 적층 공정의 난제는 이 얇고 휜 다이 수십 장을 수천 개의 범프가 전부 붙도록 정렬하고 접합하는 것이다. 현재 양산에 쓰이는 방식은 크게 둘이고, 차세대 후보가 하나 있다.

TC-NCF MR-MUF 하이브리드 본딩 열 + 압력 (다이마다) 한꺼번에 리플로우 → 액상 몰드로 충전 Cu–Cu + 산화막–산화막 직접 접합 범프·빈틈 없음 비전도성 필름을 붙이고한 장씩 열압착필름 k 낮음 · 공정 시간 김삼성·마이크론 주력 범프로 쌓은 뒤 일괄 리플로우빈틈을 EMC 몰드로 채움열전도·생산성 유리, 워피지 제어 관건SK hynix 주력 피치 10 µm 이하 가능계면 두께 ≈ 0 → 높이·열 유리파티클·평탄도에 극도로 민감16-Hi 이상 (HBM4E~) 후보
그림 7-6. 세 가지 다이 적층 방식(개략). TC-NCF는 필름을 붙인 다이를 한 장씩 열압착하고, MR-MUF는 범프로 쌓은 뒤 한 번에 리플로우하고 몰드로 빈틈을 채운다. 하이브리드 본딩은 범프 없이 구리 패드와 산화막을 직접 붙인다.

TC-NCF(Thermo-Compression with Non-Conductive Film)는 다이 뒷면에 비전도성 필름을 붙이고, 본딩 헤드가 다이 하나하나를 열과 압력으로 눌러 붙인다. 필름이 누르는 동안 흘러 범프 주변을 채우므로 휨을 누르며 붙이기 좋다. MR-MUF(Mass Reflow Molded Underfill)는 다이를 가접합으로 쌓은 뒤 한꺼번에 리플로우해 솔더를 녹여 붙이고, 액상 몰드 재료로 빈틈과 바깥을 한 번에 채운다. 일괄 처리라 생산성이 높고, 충전재의 열전도가 좋아 방열에 유리하다고 알려져 있다.

적층 수가 늘수록 문제는 높이다. 스택 높이 한도 안에 N장의 다이와 N개의 접합층을 넣어야 한다.

$$H_\text{max} \ge t_\text{base} + N\,(t_\text{core} + t_\text{bond}) + t_\text{top} \;\;\Rightarrow\;\; t_\text{core} \le \frac{H_\text{max} - t_\text{base} - t_\text{top}}{N} - t_\text{bond}$$
예: HBM4의 \(H_\text{max} = 775\) µm, \(t_\text{base} = 60\) µm, \(t_\text{top} = 40\) µm, 범프 접합 \(t_\text{bond} = 15\) µm, \(N = 16\)이면 \(t_\text{core} \le 27\) µm. 하이브리드 본딩(\(t_\text{bond} \approx 1\) µm)이면 약 41 µm까지 허용된다. (가정값은 교육용.)

이것이 JEDEC이 HBM4에서 높이 한도를 775 µm로 늘린 이유이고, 16-Hi 이상에서 하이브리드 본딩이 거론되는 이유다. 반대로 계면이 얇아질수록 열저항도 줄어든다. 다음 절에서 보듯, 열 역시 적층 수와 함께 급격히 나빠지는 문제이기 때문이다.

더미 범프와 TSV의 다른 역할

스택에는 전기 신호가 흐르지 않는 범프도 많다. 열을 위아래로 빼 주는 열 범프(더미 범프)와, 얇은 다이를 고르게 받쳐 휨과 크랙을 막는 지지 범프다. 전원·접지용 TSV도 수백 개 이상 배치되어, 수십 A에 이르는 전류를 다이마다 고르게 나누고 전원 잡음(IR 드롭)을 줄인다.

열 문제: 쌓을수록 뜨거워진다

HBM 스택의 열은 주로 위쪽으로 빠진다. 스택 윗면이 TIM을 거쳐 리드와 히트싱크에 닿아 있기 때문이다. 아래쪽 인터포저로도 일부 빠지지만, 인터포저는 옆의 GPU가 데우고 있어 오히려 열이 들어오기도 한다. 문제는 발열이 가장 큰 층 중 하나인 베이스 다이가 맨 아래에 있다는 것이다. PHY와 로직이 있는 베이스 다이의 열은 위로 빠지기 위해 모든 코어 다이와 접합층을 통과해야 한다.

히트싱크 · 리드 (T_ref) 인터포저 (GPU가 데움, T_int) 베이스 다이 P_base 코어 N 코어 1 열 흐름 T_ref R_top (TIM·리드) T_N R_bond + R_Si T_N−1 … T_1 R_bond + R_Si T_0 (베이스, 최고온) R_bot T_int P_core →P_core →P_core →P_base →
그림 7-7. HBM 스택의 1차원 열저항 모델. 각 층을 온도 노드로, 접합층과 실리콘을 직렬 저항으로, 층별 발열을 전류원으로 둔다. 위로는 히트싱크(T_ref), 아래로는 GPU가 데운 인터포저(T_int)와 연결된다.

전기 회로의 옴의 법칙처럼 열에서도 \(\Delta T = R_\text{th} Q\)가 성립한다. 열이 모두 위로 빠진다고 단순화하면, k번째 접합층에는 그 아래 모든 층의 발열이 흐른다.

$$T_0 \approx T_\text{ref} + R_\text{top} P_\text{tot} + \sum_{k=1}^{N} R_\text{bond}\Big(P_\text{base} + (k-1)P_\text{core}\Big), \qquad R_\text{bond} = \frac{t_\text{bond}}{k_\text{eff} A}$$
\(A\)는 다이 면적(약 100~120 mm²), \(t_\text{bond}\)와 \(k_\text{eff}\)는 접합층의 두께와 (범프·충전재를 합친) 유효 열전도율이다. 합의 항 수가 N에 비례하고 각 항이 다시 N에 비례해 커지므로, 온도 상승은 대략 \(N^2\)에 비례해 나빠진다.

실리콘의 열전도율은 약 130~150 W/m·K로 좋지만, 폴리머 필름이나 몰드 재료는 1 W/m·K 안팎이다. 수십 µm의 실리콘보다 10~20 µm의 접합층이 훨씬 큰 열저항을 만든다. 그래서 충전재의 열전도율을 높이고, 열 범프를 늘리고, 접합층을 얇게 하는 것이 모두 열 대책이다.

SIMULATOR

HBM 스택 층별 온도 (1D 열저항 모델)

적층 수
접합 방식
최고 온도 (위치)—
최상층 코어 온도—
스택 내 온도차—
85 °C 초과 코어 다이—
해볼 것: ① TC-NCF에서 적층 수를 4 → 16으로 올리며 온도차가 거의 N²으로 커지는 것을 확인하자. ② 같은 16-Hi에서 접합 방식을 MR-MUF, 하이브리드로 바꿔 보자(오른쪽 그래프의 흐린 선이 다른 방식의 온도 분포). ③ 인터포저 온도를 올리면(GPU가 뜨거울수록) 아래쪽 방열 경로가 막혀 베이스 다이가 더 뜨거워진다. 85 °C를 넘는 다이는 리프레시를 두 배로 해야 한다(5장). (모형 가정: 다이 면적 110 mm², 접합층 15 µm, 유효 열전도율 TC-NCF 1.0 · MR-MUF 2.2 W/m·K, 하이브리드 1 µm · 1.5 W/m·K, R_top 0.35 K/W, R_bot 1.2 K/W. 교육용 1차원 근사이며 면내 온도 분포는 무시한다.)
1차원 모델의 한계

실제 스택에서는 다이 안의 발열이 균일하지 않다. 베이스 다이의 PHY는 GPU 쪽 가장자리에 몰려 있어 그 부분이 핫스폿이 되고, 뱅크 활성화가 몰리는 코어 다이 영역도 국부적으로 뜨거워진다. 설계 단계에서는 3차원 유한요소 열해석으로 범프 배치와 TSV 위치를 최적화한다. 그래도 “접합층 열저항 × 누적 열류”라는 1차원 직관은 적층 수 증가가 왜 어려운지를 정확히 짚어 준다.

스택 수율과 KGD

다이를 쌓는 순간, 스택의 운명은 가장 약한 다이 하나에 달린다. 다이 하나라도 불량이면(또는 접합 하나라도 실패하면) 스택 전체를 버려야 한다. 이미 붙인 다이는 떼어 낼 수 없기 때문이다. 각 다이와 각 접합이 독립적으로 성공한다고 하면 스택 수율은 곱으로 줄어든다.

$$Y_\text{stack} = Y_\text{base}\; Y_\text{core}^{\,N}\; Y_\text{bond}^{\,N}$$
\(Y_\text{core}\)는 적층에 투입된 코어 다이가 양품일 확률, \(Y_\text{bond}\)는 계면 하나의 접합 수율이다. 예: 다이 수율 95%인 다이를 테스트 없이 12장(+베이스) 쌓으면 \(0.95^{13} \approx 51\%\). 절반을 버리는 셈이고, 버려지는 스택에는 멀쩡한 다이 12장이 함께 들어 있다.

그래서 적층 전에 다이를 철저히 테스트해 양품만 고르는 KGD(Known Good Die)가 필수다. 문제는 박화된 웨이퍼 상태의 다이를 고속으로, 고온에서, 수천 개의 미세 범프에 프로브를 대고 완벽하게 테스트하기가 어렵다는 것이다. 테스트가 놓친 불량(테스트 이스케이프)은 스택 안으로 들어간다. 테스트 커버리지 \(c\)일 때, 테스트를 통과한 다이가 사실은 불량일 확률은 다음과 같다.

$$p_\text{esc} = \frac{(1-Y_d)(1-c)}{Y_d + (1-Y_d)(1-c)}, \qquad Y_\text{core,eff} = 1 - p_\text{esc}$$
\(Y_d\)는 원래 다이 수율이다. 적층 후에는 여분 TSV로 끊어진 신호를 우회하거나, 여분 로우·칼럼으로 불량 셀을 대체하는 리페어로 일부 불량을 살린다.
SIMULATOR

스택 수율: KGD와 리페어의 효과

테스트 없이 적층—
KGD 적용—
KGD + 리페어—
양품 스택당 투입 다이—
해볼 것: ① 커버리지를 0%로 두면 “KGD” 곡선이 “테스트 없이” 곡선과 같아진다. ② 다이 수율 92%, 16-Hi에서 테스트 없이 쌓으면 스택 수율이 30% 아래로 떨어진다. 커버리지를 95% → 99%로 올리면 얼마나 회복되는지 보자. ③ 접합 수율을 99.0%로 낮추면 KGD로도 막을 수 없는 손실이 생긴다. 이때 리페어 구제율의 가치가 커진다. (모형: 베이스 다이도 같은 수율, 불량은 서로 독립, 리페어는 이스케이프 다이 불량과 접합 불량에 같은 비율로 적용.)

이 계산은 HBM이 비싼 이유를 보여 준다. 수율 손실이 적층 수에 대해 지수적이므로, 적층 수를 늘릴 때마다 다이 수율·테스트·접합의 모든 단계가 한 단계씩 더 좋아져야 한다. 또 HBM 코어 다이는 TSV 영역 때문에 같은 용량의 일반 DRAM 다이보다 면적이 크고, 웨이퍼당 다이 수가 적다. 2024~2025년 메모리 업계가 HBM 생산을 늘릴 때 일반 DRAM 생산 능력이 빠듯해진 것도 이 때문이다.

웨이퍼 대 웨이퍼 vs 다이 대 웨이퍼

웨이퍼 두 장을 통째로 붙이는 웨이퍼 대 웨이퍼(W2W) 접합은 정렬과 처리량이 좋지만, 불량 다이 위에도 무조건 다이를 붙이게 되어 KGD 선별이 불가능하다. 수율이 곱으로 떨어지는 적층 수가 많은 HBM에서는 테스트한 양품 다이를 골라 올리는 다이 대 웨이퍼(D2W) 방식이 쓰인다. 하이브리드 본딩도 HBM에서는 D2W로 개발되고 있다.

AI 가속기 속의 HBM

이제 시스템으로 시야를 넓히자. 최신 AI 가속기는 거대한 연산 다이(또는 두 개의 다이) 둘레에 HBM 스택을 6~8개, 많게는 12개까지 배치한다. 총 대역폭과 용량은 스택 수에 비례한다.

인터포저 (CoWoS-L 등, 레티클 수 배 크기) 연산 다이 A연산 다이 B 다이 간 고속 링크 HBMHBMHBMHBM HBMHBMHBMHBM 8 스택 × ~1 TB/s ≈ 8 TB/s · 8 × 24–36 GB = 192–288 GB HBM3E 세대 2-다이 가속기의 전형적 배치 (개략)
그림 7-8. 두 개의 연산 다이와 여덟 개의 HBM3E 스택을 한 인터포저에 올린 AI 가속기의 평면 배치(개략). 각 연산 다이의 긴 변 하나에 HBM 네 개가 붙어, 다이 가장자리(쇼어라인)를 거의 전부 메모리 PHY에 쓴다.
가속기연도HBM 스택세대용량대역폭
NVIDIA A100 (80 GB)20205 (활성)HBM2E80 GB~2.0 TB/s
NVIDIA H100 SXM20225 (활성)HBM380 GB3.35 TB/s
AMD Instinct MI300X20238HBM3192 GB5.3 TB/s
NVIDIA H20020246HBM3E141 GB4.8 TB/s
NVIDIA B2002024–20258HBM3E 8-Hi~180–192 GB~8 TB/s
NVIDIA B300 · AMD MI355X20258HBM3E 12-Hi288 GB~8 TB/s
NVIDIA Rubin20268HBM4288 GB최대 약 22 TB/s (발표치)

표의 값은 제조사 발표 기준의 대표값이며, 출시 시점과 제품 구성에 따라 달라진다. HBM4 세대 제품의 수치는 2026년 발표 기준으로, 이후 바뀔 수 있다.

LLM 추론의 디코딩 단계(토큰을 하나씩 생성)는 배치가 작을 때 가중치 전체를 매 토큰 읽어야 하는 전형적인 메모리 제한 작업이다. 그래서 가속기 한 개에 올릴 수 있는 모델 크기는 HBM 용량이, 토큰 생성 속도의 상한은 HBM 대역폭이 정한다.

$$P_\text{max} \approx \frac{C_\text{HBM}(1-r)}{b}, \qquad \text{tokens/s} \lesssim \frac{\text{BW}_\text{HBM}}{P\cdot b}$$
\(C_\text{HBM}\)은 총 HBM 용량, \(r\)은 KV 캐시·활성값 등에 남겨 둘 비율, \(b\)는 파라미터당 바이트(FP16 2, FP8 1, FP4 0.5), \(P\)는 파라미터 수다. 두 번째 식은 배치 1의 밀집(dense) 모델이 매 토큰 가중치를 한 번 읽는다고 본 상한이다.
SIMULATOR

AI 가속기 HBM 구성과 LLM

스택 종류
가중치 정밀도
총 HBM 용량—
총 대역폭—
올릴 수 있는 최대 파라미터—
70B 디코딩 상한—
해볼 것: ① HBM3E 12-Hi × 8 (288 GB)에서 FP16과 FP8을 비교해, 70B·405B 모델이 한 가속기에 들어가는지 보자. ② 스택 종류를 HBM4로 바꾸면 용량은 같아도 토큰 생성 상한이 크게 오른다. 용량과 대역폭이 서로 다른 축이라는 것을 확인하자. ③ 671B·1T급 모델은 대부분 MoE(전문가 혼합) 구조라, 용량은 전체 파라미터가 필요하지만 토큰당 읽는 가중치는 활성 파라미터(수십 B)뿐이다. (스택 대표값: HBM3 16 GB·0.82 TB/s, HBM3E 24/36 GB·1.2 TB/s, HBM4 36/48 GB·2.0 TB/s(JEDEC 8 Gb/s 기준). 실제 토큰 속도는 이 상한보다 낮다.)

HBM4에서 가장 큰 구조적 변화는 베이스 다이다. 버스가 2048비트로 넓어지고 채널이 32개로 늘면서 베이스 다이의 로직이 복잡해졌고, 메모리 업체들은 베이스 다이를 DRAM 공정이 아닌 파운드리의 로직 공정(보도 기준 12 nm~4 nm급)으로 만들기 시작했다. 트랜지스터 성능이 좋아져 PHY 전력이 줄고, 남는 면적에 고객이 원하는 로직을 넣을 수 있다. GPU 업체가 자기 메모리 컨트롤러 일부나 연산 기능을 베이스 다이에 넣는 커스텀 HBM(Custom HBM, cHBM)이 논의되는 배경이다. 이는 12장의 PIM(Processing-in-Memory)과도 맞닿아 있다.

HBM만이 답은 아니다

HBM은 용량당 가격이 비싸고 CoWoS 공급에 묶인다. 그래서 추론 전용 칩 중에는 LPDDR5X를 넓게 붙여 용량을 싸게 확보하거나, SRAM을 대량으로 넣어 대역폭을 얻는 설계도 있다. 워크로드의 연산 강도에 따라 어떤 메모리가 맞는지는 13장에서 루프라인 모델로 직접 설계해 본다.

핵심 정리

  1. 대역폭 = 버스 폭 × 핀 속도 ÷ 8. GDDR은 좁고 빠른 버스(칩당 32비트, 20~32 Gb/s), HBM은 넓고 느린 버스(스택당 1024비트, HBM4는 2048비트)로 대역폭을 얻는다.
  2. HBM이 넓은 버스를 쓸 수 있는 것은 실리콘 인터포저 위의 수 mm짜리 미세 배선 덕분이다. 선이 짧고 가늘어 비트당 에너지가 낮고(약 3~5 pJ/bit), 다이 가장자리당 대역폭 밀도가 높다.
  3. HBM 스택 = 베이스(로직) 다이 + 코어 DRAM 다이 4~16장. TSV(지름 ~5~10 µm)와 마이크로범프(피치 ~40 µm 전후)로 수직 연결하고, 2.5D 인터포저(CoWoS)에서 GPU와 연결한다.
  4. 버스는 독립 채널(HBM3 16개 × 64비트)과 의사 채널(32비트)로 나뉘어 32 B 단위로 병렬 접근한다. HBM4는 32채널·2048비트다.
  5. 세대별 스택 대역폭: HBM 128 GB/s → HBM2E ~0.46 TB/s → HBM3 0.82 TB/s → HBM3E ~1.2 TB/s → HBM4 ~2 TB/s 이상. 대역폭은 적층 수와 무관하고, 용량은 적층 수 × 다이 밀도다.
  6. 코어 다이는 비아 미들 TSV → 박화(~30~50 µm) → TSV 노출 순으로 만들고, TC-NCF 또는 MR-MUF로 적층한다. 높이 한도(720 → 775 µm) 때문에 16-Hi 이상에서는 하이브리드 본딩이 후보다.
  7. 열은 주로 위로 빠지므로 맨 아래 베이스 다이가 가장 뜨겁고, 접합층 열저항이 누적되어 온도차는 적층 수의 대략 제곱으로 커진다.
  8. 스택 수율은 \(Y_\text{die}^N Y_\text{bond}^N\)으로 지수적으로 줄어 KGD 테스트와 적층 후 리페어가 필수다. 가속기의 HBM 용량은 올릴 수 있는 모델 크기를, 대역폭은 토큰 생성 속도의 상한을 정한다.

확인 퀴즈

1. 1024비트 버스, 핀 속도 9.6 Gb/s인 HBM3E 스택 1개의 대역폭은 약 얼마인가?

1024 × 9.6 Gb/s = 9830 Gb/s이고, 8로 나누면 약 1229 GB/s ≈ 1.23 TB/s다. 비트(b)와 바이트(B)를 혼동하지 않도록 주의하자.

2. HBM이 GDDR처럼 핀 속도를 높이는 대신 버스 폭을 넓히는 전략을 쓸 수 있는 가장 직접적인 이유는?

PCB에서는 1024가닥을 GPU 옆에 까는 것이 불가능하지만, 실리콘 인터포저는 반도체 공정으로 µm급 배선을 만들 수 있다. 배선이 수 mm로 짧아 커패시턴스가 작고, 낮은 속도에서도 비트당 에너지가 작다. 셀 자체의 속도는 일반 DRAM과 비슷하다.

3. 수율 98%인 다이를 테스트 없이 베이스 1장 + 코어 12장으로 쌓았다. 접합이 완벽하다면 스택 수율은 약 얼마인가?

\(0.98^{13} \approx 0.769\). 다이 하나하나는 98%로 좋아 보여도, 13장이 모두 양품이어야 하므로 스택 수율은 77% 정도로 떨어진다. 적층 수가 많을수록 KGD 테스트가 중요한 이유다.

4. 일반적인 HBM 스택에서 가장 뜨거워지기 쉬운 층과 그 이유로 옳은 것은?

히트싱크는 스택 위에 있다. PHY와 로직으로 발열이 큰 베이스 다이는 맨 아래에 있어, 그 열이 N개의 접합층(열전도율 1 W/m·K 안팎)을 모두 지나야 한다. 게다가 아래쪽 인터포저는 GPU가 데우고 있다.

5. MR-MUF 방식에 대한 설명으로 옳은 것은?

MR-MUF(Mass Reflow Molded Underfill)는 일괄 리플로우와 몰드 언더필이 핵심이다. 첫째 보기는 하이브리드 본딩, 둘째는 TC-NCF, 넷째는 웨이퍼 대 웨이퍼(W2W) 접합이다.

6. HBM3E 12-Hi(36 GB) 스택 8개를 단 가속기에 FP8 가중치를 올리고 용량의 30%를 KV 캐시로 남긴다. 올릴 수 있는 최대 파라미터 수에 가장 가까운 것은?

총 용량 8 × 36 = 288 GB, 가중치용 288 × 0.7 ≈ 202 GB. FP8은 파라미터당 1바이트이므로 약 200B 파라미터다. FP16이면 약 100B, FP4면 약 400B가 된다.