HBM과 3D 적층
최신 AI 가속기 한 개는 초당 8 TB 이상의 데이터를 메모리에서 읽는다. 이 대역폭은 PCB 위의 메모리 칩으로는 낼 수 없다. HBM(High Bandwidth Memory)은 DRAM 다이 여러 장을 수직으로 쌓아 수천 개의 TSV로 꿰뚫고, 실리콘 인터포저 위 GPU 바로 옆에 붙여 1024~2048비트의 넓은 버스로 연결한다. 이 장에서는 HBM 패키지를 3D로 분해해 보고, 대역폭·에너지·공정·열·수율이라는 다섯 개의 렌즈로 이 구조가 왜 이렇게 생겼는지 따져 본다.
- “넓고 느린 버스”가 “좁고 빠른 버스”보다 대역폭 밀도와 비트당 에너지에서 유리한 이유를 설명할 수 있다.
- 베이스 다이, 코어 DRAM 다이, TSV, 마이크로범프, 실리콘 인터포저(2.5D/CoWoS)의 역할과 대표 치수를 안다.
- 채널·의사 채널 구조와 핀 속도로부터 스택 대역폭을 계산하고, HBM~HBM4 세대 변화를 정리할 수 있다.
- TSV 형성·박화·TC-NCF/MR-MUF/하이브리드 본딩 공정과 스택 높이 한도(720/775 µm)의 관계를 이해한다.
- 적층 구조의 열 경로와 스택 수율(\(Y^N\)), KGD의 의미를 정량적으로 추정할 수 있다.
- GPU 한 개에 붙은 HBM 스택 수로부터 총 용량·대역폭을 구하고 LLM 추론과 연결할 수 있다.
왜 HBM인가: 넓고 느린 버스
1장에서 본 메모리 월(Memory Wall)은 AI 시대에 가장 극적으로 드러났다. 대규모 언어 모델(LLM)이 토큰 하나를 생성하려면 수십~수백 GB의 가중치를 한 번씩 읽어야 하고, 이때 연산 유닛은 대부분 데이터를 기다린다. 가속기의 성능이 연산 능력(FLOPS)보다 메모리 대역폭에 묶이는 것이다(13장의 루프라인 모델).
대역폭을 올리는 방법은 두 가지뿐이다. 선 하나를 더 빨리 흔들거나, 선을 더 많이 까는 것이다.
6장의 GDDR은 첫 번째 길을 끝까지 밀어붙인 메모리다. 칩당 32비트밖에 안 되지만 핀 하나를 20~32 Gb/s로 흔든다(GDDR7은 PAM3 신호). 대신 수 cm 길이의 PCB 배선에서 반사·누화·손실을 이겨 내려면 강한 드라이버, 종단 저항, 이퀄라이저, 정교한 트레이닝이 필요하고, 비트당 에너지가 커진다. 게다가 GPU 둘레에 놓을 수 있는 칩 수는 기껏 8~16개라 총 대역폭은 약 2 TB/s 근처에서 막힌다.
HBM은 두 번째 길을 택했다. 핀 속도는 GDDR의 1/3 수준(HBM3E 약 9.6 Gb/s)으로 낮추는 대신, 스택 하나에 1024개(HBM4는 2048개)의 데이터선을 깐다. PCB로는 불가능한 숫자지만, 실리콘 인터포저 위에서는 선폭 1 µm 안팎의 배선을 수 mm만 그으면 된다. 선이 짧고 가늘어 커패시턴스가 작으니 약한 드라이버로 충분하고, 종단도 필요 없다.
에너지 측면에서 보면 차이는 더 분명하다. 데이터 전송 전력은 대역폭과 비트당 에너지의 곱이다.
대략적인 값으로 HBM3/3E는 코어와 I/O를 합쳐 약 3~5 pJ/bit, GDDR6/7은 약 6~8 pJ/bit 수준으로 알려져 있다(조건에 따라 편차가 크다). 8 TB/s를 GDDR급 에너지로 옮기면 메모리 전력만 400 W를 넘긴다. HBM이 “AI 가속기의 메모리”가 된 것은 대역폭과 전력, 두 벽을 동시에 낮췄기 때문이다.
칩 설계자는 “다이 가장자리 1 mm당 몇 GB/s를 뽑을 수 있는가”를 따진다. 이를 쇼어라인 대역폭 밀도(Shoreline Bandwidth Density)라 한다. GPU 다이의 둘레는 유한하고, 그 둘레에 PHY를 늘어놓아야 한다. HBM PHY는 마이크로범프 피치로 신호를 촘촘히 빼내므로 같은 가장자리 길이에서 PCB용 PHY보다 훨씬 많은 대역폭을 낸다. 가속기 한 개에 HBM 스택을 6~8개 이상 붙이는 이유다.
HBM 패키지의 구조
HBM 패키지를 아래에서 위로 올라가며 살펴보자. 가장 아래는 유기 재료로 만든 패키지 기판(Package Substrate)으로, 1 mm 안팎 피치의 BGA 볼로 메인보드와 연결된다. 그 위에 C4 범프(피치 약 130~150 µm)로 실리콘 인터포저(Silicon Interposer)가 올라간다. 인터포저는 트랜지스터가 없는 얇은 실리콘 판(약 100 µm)으로, 윗면의 미세 배선층(RDL)이 GPU와 HBM을 잇고, 내부의 TSV가 전원과 외부 신호를 아래 기판으로 내려보낸다. GPU와 HBM을 한 인터포저 위에 나란히 놓는 이 방식을 2.5D 패키징이라 하고, TSMC의 CoWoS(Chip-on-Wafer-on-Substrate)가 대표적이다.
HBM 스택 자체는 두 종류의 다이로 이루어진다.
- 베이스 다이(Base / Logic / Buffer Die): 스택 맨 아래. 셀 어레이 대신 GPU와 통신하는 PHY, 명령 디코딩, 테스트 로직(DFT), TSV 리페어 회로가 있다. HBM3E까지는 DRAM 공정으로 만들었지만 HBM4부터는 파운드리의 로직 공정으로 만드는 경우가 늘었다.
- 코어 다이(Core DRAM Die): 실제 셀 어레이가 있는 DRAM 다이. 4·8·12·16장(4-Hi~16-Hi)을 쌓는다. 각 다이는 4장에서 본 1T1C 어레이와 센스 앰프, 뱅크 로직을 담고, 수천 개의 TSV가 다이를 관통해 데이터·주소·전원을 위아래로 전달한다.
TSV(Through-Silicon Via)는 실리콘을 수직으로 뚫고 구리로 채운 기둥이다. 지름은 약 5~10 µm, 깊이는 박화된 다이 두께와 같은 약 30~50 µm이다. 다이와 다이 사이는 구리 필러 끝에 솔더를 올린 마이크로범프(Micro-bump)로 붙이는데, 피치는 수십 µm(약 40 µm 전후), 높이는 10~20 µm 정도다. 범프 사이의 빈틈은 언더필 재료로 메워 기계적 강도와 열전도를 확보한다.
TSV 한 개는 산화막 라이너를 유전체로 한 동축 커패시터로 볼 수 있다. 커패시턴스를 어림해 보면 PCB 배선이나 본딩 와이어보다 훨씬 작다는 것을 알 수 있다.
DRAM을 GPU 다이 위에 직접 올리면(진정한 3D) 배선은 더 짧아진다. 하지만 수백 W를 내는 GPU 위에 온도에 민감한 DRAM(5장의 리프레시 주기는 85 °C를 넘으면 절반으로 줄어든다)을 얹으면 열이 치명적이고, GPU 쪽 방열 경로도 막힌다. 그래서 현재는 옆에 놓는 2.5D가 표준이다. 인터포저 크기가 레티클 한계(약 26×33 mm)를 넘어서면서 TSMC는 여러 레티클을 이어 붙인 대형 인터포저(CoWoS-S), 작은 실리콘 브리지를 유기 기판에 박은 CoWoS-L 등으로 확장하고 있다.
3D로 보는 HBM 패키지
아래 모델은 GPU 다이 하나와 HBM 스택 네 개가 실리콘 인터포저 위에 놓인 패키지다. 가로 크기는 실제 비율에 가깝고(GPU ≈ 26×32 mm, HBM ≈ 11×10 mm), 두께 방향은 약 4배 과장했다. 적층 수를 바꾸면 스택 높이 한도 안에 다이를 끼워 넣기 위해 코어 다이가 얼마나 얇아져야 하는지가 계산된다. 분해도를 올려 층을 벌리고, 스택 확대로 앞쪽 스택에 다가가 TSV 기둥과 마이크로범프를 확인해 보자. 청록색 점은 GPU에서 코어 다이로 가는 쓰기 데이터, 주황색 점은 코어 다이에서 GPU로 돌아오는 읽기 데이터다.
2.5D HBM 패키지 분해 모델
모델에서 GPU 다이와 HBM 스택의 윗면 높이가 거의 같다는 점을 눈여겨보자. 둘 위에 하나의 리드(히트 스프레더)와 히트싱크가 얹히므로, 높이가 어긋나면 TIM 두께가 달라져 방열이 나빠진다. JEDEC이 HBM3E까지 스택 높이를 720 µm로 묶어 둔 이유다. 16-Hi를 품어야 하는 HBM4에서는 이를 775 µm로 완화했다(GPU 웨이퍼의 표준 두께와 같은 값이다).
채널과 의사 채널: 1024비트를 나누어 쓰기
1024비트 버스를 하나의 거대한 메모리처럼 쓰면 곤란하다. 접근 한 번에 1024비트 × 버스트 길이만큼의 데이터가 오가므로, GPU가 원하는 작은 데이터(캐시 라인 32~128 B)에 비해 너무 크다. 그래서 HBM은 버스를 여러 개의 독립 채널(Channel)로 나눈다. 각 채널은 자기만의 명령·주소 버스와 뱅크를 가지고 서로 다른 타이밍으로 동작한다. 사실상 스택 하나가 작은 DRAM 수십 개인 셈이다.
의사 채널(Pseudo Channel, PC)은 HBM2에서 도입되었다. 채널 하나의 128비트 데이터 버스를 64비트 두 개로 나누고, 명령·주소 버스는 공유하되 뱅크와 데이터선은 따로 쓰게 한 것이다. 한 번의 접근 크기가 절반으로 줄어 작은 무작위 접근의 효율이 올라가고, 두 PC가 번갈아 동작하면서 5장에서 본 tFAW·tRRD 같은 뱅크 제약을 분산시킨다. HBM3는 채널을 16개(64비트)로 늘리고 PC를 32비트로 줄였으며, HBM4는 채널 수를 다시 두 배(32채널, 64 PC)로 늘려 2048비트가 되었다.
GPU의 메모리 컨트롤러는 수천 개의 스레드가 쏟아내는 요청을 채널별 큐에 나누어 담는다. HBM3E 스택 8개면 의사 채널이 8 × 32 = 256개, HBM4 스택 8개면 512개다. 이 많은 독립 경로가 동시에 로우 버퍼를 열고 닫으며 대역폭을 끌어낸다. 채널이 많을수록 뱅크 충돌 확률이 낮아지고, 무작위에 가까운 AI 워크로드에서도 실효 대역폭이 피크에 가까워진다.
세대별 진화: HBM에서 HBM4까지
HBM은 SK hynix와 AMD가 공동 개발해 2013년 JEDEC 표준(JESD235)이 되었고, 2015년 AMD Radeon R9 Fury X에 처음 탑재되었다. 이후 세대마다 핀 속도를 대략 두 배씩 올렸고, HBM4에서는 처음으로 버스 폭 자체를 두 배로 넓혔다.
| 세대 | 표준/양산 | 버스 폭 | 핀 속도 (Gb/s) | 스택 대역폭 | 적층 · 용량 | 높이 한도 | 대표 제품 |
|---|---|---|---|---|---|---|---|
| HBM | 2013 / 2015 | 1024 | 1.0 | 128 GB/s | 4-Hi · 1 GB | 720 µm | AMD Fury X |
| HBM2 | 2016 | 1024 | 2.0–2.4 | 256–307 GB/s | 4/8-Hi · 4–8 GB | 720 µm | NVIDIA P100, V100 |
| HBM2E | 2019–2020 | 1024 | 3.2–3.6 | 410–460 GB/s | 4/8-Hi · 8–16 GB | 720 µm | NVIDIA A100 |
| HBM3 | 2022 | 1024 | 6.4 | 819 GB/s | 8/12-Hi · 16–24 GB | 720 µm | NVIDIA H100, AMD MI300X |
| HBM3E | 2024 | 1024 | 8–9.8 | ~1.0–1.25 TB/s | 8/12-Hi · 24–36 GB | 720 µm | H200, B200/B300, MI325X/MI355X |
| HBM4 | 2025 표준 / 2026 본격 양산 | 2048 | 8 (규격) · 약 10+ (제품) | ~2.0–2.8 TB/s | 4–16-Hi · 24–64 GB | 775 µm | NVIDIA Rubin (2026) |
표의 수치는 대표값이다. 같은 세대라도 제조사·제품마다 핀 속도가 다르고, HBM3E와 HBM4의 최고 속도는 해마다 올라가고 있다(2025~2026년 기준). 용량은 코어 다이 밀도 × 적층 수로 정해진다. 예를 들어 24 Gb(3 GB) 다이를 12장 쌓으면 36 GB, 32 Gb 다이를 16장 쌓으면 64 GB다.
HBM 대역폭 계산기와 메모리 비교
HBM은 GDDR보다 핀(데이터선)이 훨씬 많다. 이 선들이 싼 것은 PCB가 아니라 실리콘 인터포저 위에 있기 때문이다. 대신 그 대가로 인터포저·CoWoS라는 비싼 첨단 패키지 공정이 필요하고, 한동안 AI 가속기 공급의 병목은 GPU 다이가 아니라 CoWoS 생산 능력이었다. HBM의 비트당 가격도 일반 DRAM의 수 배 수준이다. HBM은 “대역폭과 에너지가 가격보다 중요한” 곳에서만 쓰인다.
적층 공정: TSV, 박화, 본딩
HBM 코어 다이는 일반 DRAM 웨이퍼 공정에 몇 가지 단계를 더해 만든다. 핵심은 TSV를 언제 뚫느냐다. 트랜지스터(FEOL)를 만든 뒤, 배선(BEOL)을 만들기 전에 TSV를 형성하는 방식을 비아 미들(Via-middle)이라 하며 HBM의 주류다. 트랜지스터 공정의 고온을 피하면서 배선층과 자연스럽게 연결할 수 있기 때문이다.
박화된 다이는 A4 용지보다 얇다(약 30~50 µm, 종이는 약 100 µm). 이렇게 얇은 실리콘은 쉽게 휘고, 열을 받으면 뒤틀린다(워피지). 적층 공정의 난제는 이 얇고 휜 다이 수십 장을 수천 개의 범프가 전부 붙도록 정렬하고 접합하는 것이다. 현재 양산에 쓰이는 방식은 크게 둘이고, 차세대 후보가 하나 있다.
TC-NCF(Thermo-Compression with Non-Conductive Film)는 다이 뒷면에 비전도성 필름을 붙이고, 본딩 헤드가 다이 하나하나를 열과 압력으로 눌러 붙인다. 필름이 누르는 동안 흘러 범프 주변을 채우므로 휨을 누르며 붙이기 좋다. MR-MUF(Mass Reflow Molded Underfill)는 다이를 가접합으로 쌓은 뒤 한꺼번에 리플로우해 솔더를 녹여 붙이고, 액상 몰드 재료로 빈틈과 바깥을 한 번에 채운다. 일괄 처리라 생산성이 높고, 충전재의 열전도가 좋아 방열에 유리하다고 알려져 있다.
적층 수가 늘수록 문제는 높이다. 스택 높이 한도 안에 N장의 다이와 N개의 접합층을 넣어야 한다.
이것이 JEDEC이 HBM4에서 높이 한도를 775 µm로 늘린 이유이고, 16-Hi 이상에서 하이브리드 본딩이 거론되는 이유다. 반대로 계면이 얇아질수록 열저항도 줄어든다. 다음 절에서 보듯, 열 역시 적층 수와 함께 급격히 나빠지는 문제이기 때문이다.
스택에는 전기 신호가 흐르지 않는 범프도 많다. 열을 위아래로 빼 주는 열 범프(더미 범프)와, 얇은 다이를 고르게 받쳐 휨과 크랙을 막는 지지 범프다. 전원·접지용 TSV도 수백 개 이상 배치되어, 수십 A에 이르는 전류를 다이마다 고르게 나누고 전원 잡음(IR 드롭)을 줄인다.
열 문제: 쌓을수록 뜨거워진다
HBM 스택의 열은 주로 위쪽으로 빠진다. 스택 윗면이 TIM을 거쳐 리드와 히트싱크에 닿아 있기 때문이다. 아래쪽 인터포저로도 일부 빠지지만, 인터포저는 옆의 GPU가 데우고 있어 오히려 열이 들어오기도 한다. 문제는 발열이 가장 큰 층 중 하나인 베이스 다이가 맨 아래에 있다는 것이다. PHY와 로직이 있는 베이스 다이의 열은 위로 빠지기 위해 모든 코어 다이와 접합층을 통과해야 한다.
전기 회로의 옴의 법칙처럼 열에서도 \(\Delta T = R_\text{th} Q\)가 성립한다. 열이 모두 위로 빠진다고 단순화하면, k번째 접합층에는 그 아래 모든 층의 발열이 흐른다.
실리콘의 열전도율은 약 130~150 W/m·K로 좋지만, 폴리머 필름이나 몰드 재료는 1 W/m·K 안팎이다. 수십 µm의 실리콘보다 10~20 µm의 접합층이 훨씬 큰 열저항을 만든다. 그래서 충전재의 열전도율을 높이고, 열 범프를 늘리고, 접합층을 얇게 하는 것이 모두 열 대책이다.
HBM 스택 층별 온도 (1D 열저항 모델)
실제 스택에서는 다이 안의 발열이 균일하지 않다. 베이스 다이의 PHY는 GPU 쪽 가장자리에 몰려 있어 그 부분이 핫스폿이 되고, 뱅크 활성화가 몰리는 코어 다이 영역도 국부적으로 뜨거워진다. 설계 단계에서는 3차원 유한요소 열해석으로 범프 배치와 TSV 위치를 최적화한다. 그래도 “접합층 열저항 × 누적 열류”라는 1차원 직관은 적층 수 증가가 왜 어려운지를 정확히 짚어 준다.
스택 수율과 KGD
다이를 쌓는 순간, 스택의 운명은 가장 약한 다이 하나에 달린다. 다이 하나라도 불량이면(또는 접합 하나라도 실패하면) 스택 전체를 버려야 한다. 이미 붙인 다이는 떼어 낼 수 없기 때문이다. 각 다이와 각 접합이 독립적으로 성공한다고 하면 스택 수율은 곱으로 줄어든다.
그래서 적층 전에 다이를 철저히 테스트해 양품만 고르는 KGD(Known Good Die)가 필수다. 문제는 박화된 웨이퍼 상태의 다이를 고속으로, 고온에서, 수천 개의 미세 범프에 프로브를 대고 완벽하게 테스트하기가 어렵다는 것이다. 테스트가 놓친 불량(테스트 이스케이프)은 스택 안으로 들어간다. 테스트 커버리지 \(c\)일 때, 테스트를 통과한 다이가 사실은 불량일 확률은 다음과 같다.
스택 수율: KGD와 리페어의 효과
이 계산은 HBM이 비싼 이유를 보여 준다. 수율 손실이 적층 수에 대해 지수적이므로, 적층 수를 늘릴 때마다 다이 수율·테스트·접합의 모든 단계가 한 단계씩 더 좋아져야 한다. 또 HBM 코어 다이는 TSV 영역 때문에 같은 용량의 일반 DRAM 다이보다 면적이 크고, 웨이퍼당 다이 수가 적다. 2024~2025년 메모리 업계가 HBM 생산을 늘릴 때 일반 DRAM 생산 능력이 빠듯해진 것도 이 때문이다.
웨이퍼 두 장을 통째로 붙이는 웨이퍼 대 웨이퍼(W2W) 접합은 정렬과 처리량이 좋지만, 불량 다이 위에도 무조건 다이를 붙이게 되어 KGD 선별이 불가능하다. 수율이 곱으로 떨어지는 적층 수가 많은 HBM에서는 테스트한 양품 다이를 골라 올리는 다이 대 웨이퍼(D2W) 방식이 쓰인다. 하이브리드 본딩도 HBM에서는 D2W로 개발되고 있다.
AI 가속기 속의 HBM
이제 시스템으로 시야를 넓히자. 최신 AI 가속기는 거대한 연산 다이(또는 두 개의 다이) 둘레에 HBM 스택을 6~8개, 많게는 12개까지 배치한다. 총 대역폭과 용량은 스택 수에 비례한다.
| 가속기 | 연도 | HBM 스택 | 세대 | 용량 | 대역폭 |
|---|---|---|---|---|---|
| NVIDIA A100 (80 GB) | 2020 | 5 (활성) | HBM2E | 80 GB | ~2.0 TB/s |
| NVIDIA H100 SXM | 2022 | 5 (활성) | HBM3 | 80 GB | 3.35 TB/s |
| AMD Instinct MI300X | 2023 | 8 | HBM3 | 192 GB | 5.3 TB/s |
| NVIDIA H200 | 2024 | 6 | HBM3E | 141 GB | 4.8 TB/s |
| NVIDIA B200 | 2024–2025 | 8 | HBM3E 8-Hi | ~180–192 GB | ~8 TB/s |
| NVIDIA B300 · AMD MI355X | 2025 | 8 | HBM3E 12-Hi | 288 GB | ~8 TB/s |
| NVIDIA Rubin | 2026 | 8 | HBM4 | 288 GB | 최대 약 22 TB/s (발표치) |
표의 값은 제조사 발표 기준의 대표값이며, 출시 시점과 제품 구성에 따라 달라진다. HBM4 세대 제품의 수치는 2026년 발표 기준으로, 이후 바뀔 수 있다.
LLM 추론의 디코딩 단계(토큰을 하나씩 생성)는 배치가 작을 때 가중치 전체를 매 토큰 읽어야 하는 전형적인 메모리 제한 작업이다. 그래서 가속기 한 개에 올릴 수 있는 모델 크기는 HBM 용량이, 토큰 생성 속도의 상한은 HBM 대역폭이 정한다.
AI 가속기 HBM 구성과 LLM
HBM4에서 가장 큰 구조적 변화는 베이스 다이다. 버스가 2048비트로 넓어지고 채널이 32개로 늘면서 베이스 다이의 로직이 복잡해졌고, 메모리 업체들은 베이스 다이를 DRAM 공정이 아닌 파운드리의 로직 공정(보도 기준 12 nm~4 nm급)으로 만들기 시작했다. 트랜지스터 성능이 좋아져 PHY 전력이 줄고, 남는 면적에 고객이 원하는 로직을 넣을 수 있다. GPU 업체가 자기 메모리 컨트롤러 일부나 연산 기능을 베이스 다이에 넣는 커스텀 HBM(Custom HBM, cHBM)이 논의되는 배경이다. 이는 12장의 PIM(Processing-in-Memory)과도 맞닿아 있다.
HBM은 용량당 가격이 비싸고 CoWoS 공급에 묶인다. 그래서 추론 전용 칩 중에는 LPDDR5X를 넓게 붙여 용량을 싸게 확보하거나, SRAM을 대량으로 넣어 대역폭을 얻는 설계도 있다. 워크로드의 연산 강도에 따라 어떤 메모리가 맞는지는 13장에서 루프라인 모델로 직접 설계해 본다.
핵심 정리
- 대역폭 = 버스 폭 × 핀 속도 ÷ 8. GDDR은 좁고 빠른 버스(칩당 32비트, 20~32 Gb/s), HBM은 넓고 느린 버스(스택당 1024비트, HBM4는 2048비트)로 대역폭을 얻는다.
- HBM이 넓은 버스를 쓸 수 있는 것은 실리콘 인터포저 위의 수 mm짜리 미세 배선 덕분이다. 선이 짧고 가늘어 비트당 에너지가 낮고(약 3~5 pJ/bit), 다이 가장자리당 대역폭 밀도가 높다.
- HBM 스택 = 베이스(로직) 다이 + 코어 DRAM 다이 4~16장. TSV(지름 ~5~10 µm)와 마이크로범프(피치 ~40 µm 전후)로 수직 연결하고, 2.5D 인터포저(CoWoS)에서 GPU와 연결한다.
- 버스는 독립 채널(HBM3 16개 × 64비트)과 의사 채널(32비트)로 나뉘어 32 B 단위로 병렬 접근한다. HBM4는 32채널·2048비트다.
- 세대별 스택 대역폭: HBM 128 GB/s → HBM2E ~0.46 TB/s → HBM3 0.82 TB/s → HBM3E ~1.2 TB/s → HBM4 ~2 TB/s 이상. 대역폭은 적층 수와 무관하고, 용량은 적층 수 × 다이 밀도다.
- 코어 다이는 비아 미들 TSV → 박화(~30~50 µm) → TSV 노출 순으로 만들고, TC-NCF 또는 MR-MUF로 적층한다. 높이 한도(720 → 775 µm) 때문에 16-Hi 이상에서는 하이브리드 본딩이 후보다.
- 열은 주로 위로 빠지므로 맨 아래 베이스 다이가 가장 뜨겁고, 접합층 열저항이 누적되어 온도차는 적층 수의 대략 제곱으로 커진다.
- 스택 수율은 \(Y_\text{die}^N Y_\text{bond}^N\)으로 지수적으로 줄어 KGD 테스트와 적층 후 리페어가 필수다. 가속기의 HBM 용량은 올릴 수 있는 모델 크기를, 대역폭은 토큰 생성 속도의 상한을 정한다.
확인 퀴즈
1. 1024비트 버스, 핀 속도 9.6 Gb/s인 HBM3E 스택 1개의 대역폭은 약 얼마인가?
2. HBM이 GDDR처럼 핀 속도를 높이는 대신 버스 폭을 넓히는 전략을 쓸 수 있는 가장 직접적인 이유는?
3. 수율 98%인 다이를 테스트 없이 베이스 1장 + 코어 12장으로 쌓았다. 접합이 완벽하다면 스택 수율은 약 얼마인가?
4. 일반적인 HBM 스택에서 가장 뜨거워지기 쉬운 층과 그 이유로 옳은 것은?
5. MR-MUF 방식에 대한 설명으로 옳은 것은?
6. HBM3E 12-Hi(36 GB) 스택 8개를 단 가속기에 FP8 가중치를 올리고 용량의 30%를 KV 캐시로 남긴다. 올릴 수 있는 최대 파라미터 수에 가장 가까운 것은?