Chapter 09

3D NAND

2010년대 초, 평면 NAND는 셀 피치 15 nm 부근에서 물리적 벽에 부딪혔다. 셀 하나에 남은 전자는 수십 개에 불과했고 이웃 셀끼리 서로의 문턱 전압을 흔들었다. 업계의 답은 “더 작게”가 아니라 “위로”였다. 셀 스트링을 90° 세워 수백 층의 워드라인이 하나의 수직 채널을 감싸게 만든 것이다. 이 장에서는 오늘날 300~400단대까지 올라간 3D NAND의 구조와 공정, 그리고 적층이 가져온 새로운 문제들을 3D 모델과 시뮬레이터로 살펴본다.

평면 NAND의 한계, 그리고 수직으로

8장에서 본 평면 NAND는 기판 위에 셀 트랜지스터 32~64개를 가로로 직렬 연결한 스트링(String)을 기본 단위로 한다. 용량을 늘리는 방법은 오직 하나, 셀 피치를 줄이는 것이었다. 그러나 피치가 20 nm 아래로 내려가자 세 가지 문제가 동시에 폭발했다.

해법은 발상의 전환이었다. 스트링을 기판 위에 눕히지 말고 세우자. 워드라인을 얇은 판으로 만들어 층층이 쌓고, 판들을 수직으로 관통하는 구멍(채널 홀(Channel Hole)) 안에 채널을 만들면, 한 번의 식각으로 수십~수백 개 셀이 동시에 생긴다. 셀의 크기는 노광 선폭이 아니라 막의 두께가 정한다. 막 두께는 증착으로 수 nm 단위까지 정밀하게 조절할 수 있으니, 선폭 미세화 없이도 밀도를 올릴 수 있다.

평면 NAND (2D) 실리콘 기판 (채널은 표면) GSL SSL WL0 … WLn (가로로 나열) BL 셀 크기 = 노광 선폭(F)이 결정 → 4F² 한계 F ≈ 15 nm에서 전자 수·간섭·비용의 벽 90° 세우기 수직 NAND (3D) 공통 소스 BL SSL GSL WL 판 (층층이) 셀 크기 = 막 두께가 결정 → 층 수로 밀도 증가
그림 9-1. 평면 NAND 스트링(왼쪽)을 90° 세우면 수직 NAND 스트링(오른쪽)이 된다. 워드라인은 기판과 평행한 판이 되고, 채널은 그 판들을 관통하는 원기둥이 된다. 한 개의 채널 홀에 워드라인 층 수만큼의 셀이 생긴다.
직관: 아파트를 짓는 것과 같다

땅(웨이퍼 면적)이 비싸 집을 더 작게 쪼개는 대신 층수를 올린 것이다. 평면 NAND가 “방을 계속 좁히는” 전략이었다면 3D NAND는 “층을 계속 올리는” 전략이다. 그래서 3D NAND의 셀 자체는 오히려 평면 말기(15 nm)보다 훨씬 크다. 채널 홀 지름은 약 100 nm 안팎이다.

BiCS와 TCAT: 원통형 차지 트랩 셀

수직 NAND의 기본 개념은 2007년 도시바가 발표한 BiCS(Bit Cost Scalable)에서 시작되었다. 절연막과 게이트 전극(폴리실리콘)을 번갈아 쌓고, 한꺼번에 구멍을 뚫은 뒤 구멍 벽에 저장막과 채널을 입히는 방식이다. 핵심은 “층 수를 늘려도 노광 단계 수가 거의 늘지 않는다”는 점, 즉 비트당 비용이 적층으로 줄어든다(Bit Cost Scalable)는 데 있다.

2009년 삼성은 TCAT(Terabit Cell Array Transistor)을 발표했다. 게이트 전극 대신 질화막(SiN)을 희생층으로 쌓아 두었다가, 나중에 이를 녹여 내고 그 자리에 텅스텐(W) 금속 게이트를 채우는 게이트 대체(Replacement Gate) 방식이다. 금속 게이트는 폴리실리콘보다 저항이 훨씬 낮아 수 mm 길이의 워드라인 RC 지연이 줄고, 고유전율 블로킹막(Al₂O₃)과 조합해 소거 특성도 좋아진다. 2013년 삼성이 24단 V-NAND를 처음 양산한 이후 대부분의 제조사가 ON(산화막/질화막) 적층 + 게이트 대체 구조로 수렴했다.

게이트 올 어라운드 셀의 해부

채널 홀을 위에서 내려다보면 동심원 구조가 보인다. 바깥에서부터 워드라인(W) → 블로킹 산화막 → 차지 트랩 질화막(CTN) → 터널 산화막 → 폴리실리콘 채널 → 코어 산화막 순서다. 게이트가 채널을 360° 감싸므로 게이트 올 어라운드(GAA, Gate-All-Around) 구조이고, 저장은 8장에서 본 플로팅 게이트가 아니라 절연체인 질화막의 트랩에 전자를 가두는 차지 트랩(CTF, Charge Trap Flash) 방식이다. 질화막은 절연체라서 전자가 한곳에 머물고, 셀 간 저장막을 끊지 않아도 된다. 수직 구조에서 층마다 플로팅 게이트를 분리해 만드는 일은 매우 어렵기 때문에, 이것이 차지 트랩이 3D NAND의 표준이 된 결정적 이유다.

(a) 위에서 본 단면 코어 SiO₂ 워드라인 W (게이트) 블로킹 산화막 (SiO₂/Al₂O₃) ~6–10 nm 차지 트랩 질화막 (SiN) ~5–7 nm 터널 산화막 ~4–6 nm 폴리실리콘 채널 ~5–10 nm 홀 지름 ≈ 90–130 nm 게이트가 채널을 360° 감쌈 (GAA) 얇은 채널 + 코어 = “마카로니” 채널 (b) 세로 단면 셀 1개 WL n+1 WL n−1 SiO₂ CTN은 위아래로 이어져 있다 (측면 전하 이동의 원인, 8절)
그림 9-2. 원통형 차지 트랩 셀. (a) 동심원 게이트 스택은 바깥의 워드라인에서 안쪽 코어까지 이어진다. (b) 세로 단면에서 한 워드라인 판이 홀을 감싸는 부분이 셀 하나이고, 판 사이의 산화막이 셀을 구분한다. 저장막(CTN)과 채널은 스트링 전체에 걸쳐 끊기지 않는다.

마카로니 채널

채널은 단결정이 아니라 증착으로 만든 폴리실리콘이다. 폴리실리콘에는 결정립계(Grain Boundary)가 있고, 그 계면의 트랩이 전자 이동도를 떨어뜨리고 셀마다 Vt 편차를 만든다. 채널을 속이 꽉 찬 기둥으로 만들면 결정립계가 많아지고, 게이트에서 먼 중심부는 제어도 잘 안 된다. 그래서 채널을 5~10 nm 두께의 얇은 관으로만 입히고 안쪽을 산화막으로 채운다. 단면이 마카로니 파스타처럼 생겼다고 해서 마카로니 채널(Macaroni Channel)이라 부른다. 얇은 채널은 SOI처럼 완전 공핍되어 게이트 제어력(서브문턱 기울기)이 좋아지고, 트랩 부피가 줄어 편차도 줄어든다.

곡률이 만드는 전계 집중

원통형 셀의 숨은 장점은 전계 분포다. 원통 축전기에서 전속밀도 \(D\)는 반지름에 반비례한다(\(D = Q/2\pi r L\)). 따라서 안쪽의 터널 산화막에는 전계가 몰리고 바깥의 블로킹막은 전계가 약해진다. 여러 유전층이 겹친 원통에서 반지름 \(r\)의 전계는 다음과 같다.

$$E(r) = \frac{V_G}{\varepsilon(r)\, r \displaystyle\sum_i \frac{1}{\varepsilon_i}\ln\frac{r_{i+1}}{r_i}}$$
여기서 \(V_G\)는 게이트–채널 사이 전압, \(r_i, r_{i+1}\)은 \(i\)번째 유전층의 안/바깥 반지름, \(\varepsilon_i\)는 그 층의 비유전율. 평면(\(r\to\infty\))이면 \(\ln(r_{i+1}/r_i)\approx t_i/r\)가 되어 익숙한 \(E_i = V_G/(\varepsilon_i\sum t_j/\varepsilon_j)\)로 돌아간다.

프로그램 시 터널막 전계가 커지면 FN 터널링 전류(8장)가 지수적으로 커지고, 반대로 블로킹막 전계는 작아서 트랩된 전자가 게이트 쪽으로 새거나 소거 시 게이트에서 전자가 거꾸로 주입되는 현상(백 터널링)이 억제된다. 같은 전압으로 더 빨리 쓰고, 덜 새는 셀이 되는 것이다. 이 장점은 홀 반지름이 작을수록 커지지만, 이는 곧 홀 지름이 다른 셀은 속도도 다르다는 뜻이기도 하다. 5절의 테이퍼 문제로 이어진다.

SIMULATOR

채널 홀 단면과 반지름 방향 전계

블로킹막 재료
터널막 전계 (원통)—
블로킹막 전계 (바깥면)—
터널막 전계 (평면 가정)—
곡률 이득—
코어 반지름—
해볼 것: ① 홀 반지름을 80 nm에서 30 nm로 줄이며 “곡률 이득”을 보자. 작은 홀일수록 터널막 전계는 커지고 블로킹막 전계는 작아진다. ② 블로킹막을 고유전율(Al₂O₃ 포함)로 바꾸면 블로킹막 전계가 더 떨어지고 같은 VG에서 터널막 전계가 올라간다. 소거 시 게이트 백 주입을 막는 데 유리하다. ③ 채널을 두껍게 하면 코어가 좁아지며 반지름 r₁이 줄어 전계가 조금 오른다. (교육용: 트랩 전하와 채널 전위는 무시한 정전기 모델)

구조와 공정: 쌓고, 뚫고, 바꾸고, 잇는다

3D NAND의 셀 어레이는 대략 다음 순서로 만들어진다. 모든 단계는 수백 층을 한 번에 처리한다는 데 의미가 있다. 층 수가 두 배가 되어도 노광 단계는 거의 그대로이고, 늘어나는 것은 증착 시간과 식각 깊이다.

  1. ON 교대 적층 — 화학기상증착(CVD)으로 SiO₂와 Si₃N₄를 한 층에 각각 20~30 nm 정도씩 번갈아 수백 층 쌓는다. 층 쌍의 두께(워드라인 피치)는 세대에 따라 약 60 nm에서 40 nm대로 줄어 왔다.
  2. 채널 홀 식각 — 지름 약 100 nm의 구멍을 수 µm 깊이로 뚫는다. 종횡비가 수십 : 1에 이르는 고종횡비 식각(HARC, High Aspect Ratio Contact etch)이다. 3D NAND 공정에서 가장 어려운 단계로 꼽힌다.
  3. 채널 형성 — 원자층 증착(ALD)으로 블로킹 산화막, 질화막, 터널 산화막을 홀 벽에 차례로 입히고, 폴리실리콘 채널을 얇게 입힌 뒤 가운데를 산화막(코어)으로 채운다. 바닥은 식각으로 열어 소스와 연결한다.
  4. 슬릿 식각 — 블록 경계를 따라 적층 전체를 관통하는 긴 도랑(슬릿(Slit))을 판다.
  5. 게이트 대체 — 슬릿을 통해 뜨거운 인산(H₃PO₄)을 흘려 넣어 질화막만 선택적으로 녹여 낸다. 산화막 층들은 채널 기둥이 받쳐 주어 무너지지 않는다. 비어 있는 틈에 (Al₂O₃ 블로킹막과) TiN 장벽층, 텅스텐을 채우면 워드라인이 된다.
  6. 공통 소스와 배선 — 슬릿 벽을 절연하고 가운데를 텅스텐 등으로 채워 공통 소스 라인(CSL)으로 쓴다(또는 CuA 구조에서는 바닥의 소스 판에 연결). 이어서 계단 영역에 워드라인 컨택을, 홀 위에 비트라인을 형성한다.
① ON 교대 적층 SiO₂ / Si₃N₄ × 수백 층 ② 채널 홀 식각 (HARC) 위가 넓고 아래가 좁은 테이퍼 ③ ONO + 채널 + 코어 ALD로 동심원 막 형성 ④ 슬릿 식각 블록 경계에 긴 도랑 ⑤ 질화막 제거 (인산) 빈 틈을 채널 기둥이 지탱 ⑥ W 채움 · 공통 소스 워드라인 완성, 슬릿 = 소스 라인
그림 9-3. 게이트 대체 방식 3D NAND의 핵심 공정 6단계(단순화). 질화막(주황)은 워드라인 자리를 잡아 두는 희생층이고, 마지막에 텅스텐(회색)으로 바뀐다. 모든 단계가 수백 층에 대해 한 번에 이루어진다.

계단 컨택: 수백 개 워드라인에 전선 잇기

층층이 쌓인 워드라인 판에 각각 전압을 걸려면 판마다 위에서 접근할 수 있는 착지점이 있어야 한다. 그래서 어레이 가장자리를 계단 모양으로 깎는다. 아래층 판일수록 더 길게 뻗어 나와 있고, 각 계단 끝에 수직 컨택을 내린다. 이것이 계단 구조(Staircase)다. 계단은 포토레지스트를 조금씩 깎아 내며(트림) 한 층씩 식각하는 트림–식각(Trim-Etch) 반복으로 만든다. 레지스트 한 번으로 여러 계단을 깎을 수 있지만 수백 층이면 이 과정 자체가 상당한 비용이다.

어레이 영역 계단(스테어케이스) 영역 소스 판 비트라인 (홀 위) GSL SSL 아래층일수록 길게 뻗어 착지점 확보 → 층 수 × 계단 폭만큼 면적 필요 셀 = WL 판 × 채널 홀 교차점
그림 9-4. 어레이–계단 영역의 단면(층 수 대폭 축소). 맨 아래 GSL과 맨 위 SSL(보라)은 선택 트랜지스터용이다. 계단 끝마다 컨택(회색 기둥)이 내려가 해당 워드라인에 전압을 전달한다. 층이 늘수록 계단 길이와 컨택 수가 함께 늘어난다.

블록과 블록 사이는 슬릿이 나눈다. 슬릿은 게이트 대체의 통로이자, 워드라인 판을 블록 단위로 자르는 칼이고, 동시에 공통 소스 라인이 된다. 하나의 블록 안에서도 맨 위 SSL 층만 얕게 잘라(String Select Cut) 여러 개의 스트링 그룹으로 나눈다. 같은 비트라인에 연결된 여러 홀 중 어느 것을 읽을지를 SSL이 고르는 것이다. 이제 전체 구조를 3D로 보자.

3D

3D V-NAND 블록 모델

드래그 회전 · 휠/핀치 확대
채널 홀 데크
주변 회로 배치
표시 요소
구성—
모델 셀 수—
선택 셀 주소—
환산 스택 높이 (피치 45 nm)—
해볼 것: ① “워드라인 W”를 끄면 판 사이를 관통하는 채널 홀이 드러난다. 홀이 위가 넓고 아래가 좁은 것에 주목하자. ② “단면 자르기”를 켜고 확대하면 홀 안의 동심원 구조(ONO 주황–폴리 채널 적갈색–코어 흰색)가 보인다. ③ 선택 워드라인과 스트링을 바꾸면 해당 판·홀·비트라인이 강조된다. 셀 하나는 WL 판 하나와 홀 하나의 교차점이다. ④ 주변 회로를 “옆”→“CuA”→“본딩”으로 바꿔 보자. 본딩에서는 어레이가 뒤집혀 비트라인이 아래쪽 CMOS 웨이퍼와 맞붙는다. ⑤ 데크를 “더블”로 바꾸면 홀이 중간에서 이어지고 테이퍼가 두 번 반복된다. (층 수·홀 수는 실제보다 크게 줄인 모형)

적층 수 경쟁: 24단에서 400단대로

2013년 24단으로 시작한 3D NAND의 적층 수는 대략 1~2년마다 1.3~1.5배씩 늘어 2024~2025년 300단 안팎에 이르렀고, 2026년에는 400단대 제품의 초기 양산이 시작되었다. 아래 표는 대표적인 이정표다. 제조사마다 “단수”를 세는 방법(더미 층, 선택 트랜지스터 포함 여부)이 달라 숫자는 참고용이며, 연도는 양산 또는 발표 기준의 대략값이다.

연도(약)대표 단수예시구조상 특징
201324삼성 1세대 V-NAND (128Gb MLC)최초 양산, 차지 트랩 + 게이트 대체
201432삼성 2세대3D NAND TLC 도입
2015~201648삼성 3세대, 도시바 BiCS2256Gb TLC
2016~201764삼성 4세대, BiCS3, 인텔·마이크론인텔·마이크론은 32+32 더블 데크 + CuA
201892~96삼성 5세대(9x단), BiCS4, SK하이닉스SK하이닉스 PUC(“4D NAND”)
2019~20201xx~128삼성 6세대, SK하이닉스 128단삼성은 싱글 스택 유지
2020~2021176마이크론, SK하이닉스, 삼성 7세대더블 데크 일반화, 삼성 COP 도입
2022~2023218~238마이크론 232, SK하이닉스 238, 삼성 8세대(~236), YMTC 232, 키옥시아 BiCS8 2181Tb TLC 다이, 웨이퍼 본딩(Xtacking, CBA) 확산
2024~2025~276~321마이크론 G9(276), 삼성 9세대(~286), SK하이닉스 321SK하이닉스 321단은 트리플 데크
2026~332~400+키옥시아·샌디스크 BiCS10(332단) 양산 개시, 삼성 10세대(400단대) 초기 양산본딩 기반 구조로 이동 추세
0100200300400 적층 수 (단) 2432486496128176~236~286321400+ 20132014201520172018201920212022202420252026 싱글 데크 중심 멀티 데크(더블/트리플) 중심 대표값 · 연도는 대략값
그림 9-5. 3D NAND 적층 수의 추이(대표값). 100단 안팎까지는 한 번에 홀을 뚫는 싱글 데크가 주류였으나, 170단 이상에서는 두세 번에 나누어 뚫는 멀티 데크가 일반화되었다.

적층이 늘면 스택 높이도 커진다. 워드라인 피치를 45 nm라 하면 300단 스택은 13 µm를 넘는다. 머리카락 굵기의 약 1/6이다. 그래서 적층 경쟁은 단순히 “층을 더 쌓는 것”이 아니라 층을 얇게 만드는 것(피치 축소)과 깊은 구멍을 뚫는 것의 싸움이기도 하다. 층을 너무 얇게 하면 워드라인 저항이 커지고 인접 워드라인 간 간섭이 늘어난다(8절).

“단수”를 그대로 비교하지 말 것

발표되는 단수에는 데이터 저장용 워드라인 외에 더미 워드라인, 선택 트랜지스터 층이 섞여 있고 회사마다 기준이 다르다. 또한 같은 단수라도 홀 피치, 어레이 효율, CuA 여부에 따라 비트 밀도는 크게 다르다. 제품 비교에는 단수보다 Gb/mm²(7절)가 더 공정한 지표다.

고종횡비 식각과 멀티 데크

지름 100 nm에 깊이 6 µm인 구멍의 종횡비(Aspect Ratio)는 60 : 1이다. 이는 지름 1 m, 깊이 60 m짜리 우물을 오차 없이 곧게 파는 것과 같다. 플라즈마 식각에서 이온은 구멍 깊숙이 갈수록 측벽에 부딪혀 에너지를 잃고, 식각 부산물은 빠져나오기 어려워진다. 결과적으로 식각 속도가 깊이에 따라 느려지고(ARDE, Aspect Ratio Dependent Etching), 구멍은 아래로 갈수록 좁아지는 테이퍼(Taper) 모양이 된다. 휘거나(Bowing) 비틀리는(Twisting) 결함, 바닥까지 못 뚫는 Not-Open 불량도 깊이와 함께 급증한다.

$$\mathrm{AR} = \frac{H}{d_{top}} = \frac{N\, t_{pair}}{d_{top}}, \qquad d(z) = d_{top} - 2z\tan\alpha$$
여기서 \(N\)은 층 수, \(t_{pair}\)는 산화막+워드라인 한 쌍의 두께, \(z\)는 홀 위에서부터의 깊이, \(\alpha\)는 측벽이 수직에서 기운 각도. \(\alpha\)가 0.2°만 되어도 6 µm 깊이에서 지름이 약 40 nm 줄어든다.

멀티 데크: 나눠서 뚫기

한 번에 뚫을 수 있는 깊이에는 한계가 있으므로, 적층을 두세 덩어리(데크(Deck))로 나누어 쌓고 뚫기를 반복한다. 아래 데크를 쌓고 홀을 뚫어 희생막으로 채운 뒤, 위 데크를 쌓고 다시 홀을 뚫어 아래 홀과 정렬해 잇는다. 이음부에는 약간 넓은 연결 플러그(Inter-Deck Plug)를 두어 정렬 오차를 흡수한다. 데크마다 테이퍼가 다시 시작되므로 홀 지름 편차가 줄지만, 공정 단계가 늘고 정렬 불량이라는 새 위험이 생긴다.

싱글 데크 더블 데크 트리플 데크 위 48 → 아래 20 (편차 큼) 데크 이음부(연결 플러그) 테이퍼 2번 반복 예: SK하이닉스 321단(약 2024~25) 가로 방향은 크게 과장 · 실제 홀은 지름 ~100 nm, 깊이 수~10여 µm
그림 9-6. 싱글·더블·트리플 데크 채널 홀. 데크를 나누면 한 번에 뚫는 깊이(종횡비)가 줄고 홀 지름 편차도 작아지지만, 데크 사이를 정렬해 이어야 하고 공정 단계가 늘어난다.

홀 지름이 깊이에 따라 달라지면 2절에서 본 곡률 효과 때문에 셀 특성도 달라진다. 아래쪽 좁은 홀의 셀은 터널막 전계가 커서 프로그램·소거가 빠르고, 위쪽 넓은 홀의 셀은 느리다. 그러면 같은 ISPP 펄스로 쓸 때 워드라인마다 Vt 분포 위치가 달라진다. 컨트롤러와 칩 내부 알고리즘은 워드라인을 여러 구역(zone)으로 나누어 시작 전압과 스텝, 검증 전압을 구역별로 조정해 이 편차를 보정한다(10장, 11장).

SIMULATOR

채널 홀 식각 테이퍼와 워드라인별 셀 속도

데크 수
스택 높이—
데크당 종횡비—
최소 지름 (데크 바닥)—
속도 편차 (최고/최저)—
해볼 것: ① 176단 싱글 데크에서 α를 0.2°로 두면 바닥 지름이 얼마나 줄어드는지, 속도 편차가 몇 배인지 보자. ② 데크를 2, 3으로 늘리면 테이퍼가 톱니처럼 반복되며 편차가 크게 줄어든다. ③ α가 너무 크면 홀이 바닥에서 막힌다(Not-Open). 적층 수를 400단으로 올려 싱글 데크가 왜 불가능한지 확인하자. (셀 속도 = 같은 펄스에서 FN 전류비, 게이트 스택 5/6/8 nm, VG 18 V 가정의 교육용 모델)
SIMULATOR

데크 수 선택: 식각 수율 vs 공정 비용

싱글 데크 종횡비—
최적 데크 수—
최적 시 어레이 수율—
양품당 상대 비용—
해볼 것: ① 적층 수를 100단 → 200단 → 320단으로 올리며 최적 데크 수가 1 → 2 → 3으로 바뀌는 지점을 찾아보자. ② 식각 기술이 좋아져 ARc가 커지면 같은 단수를 더 적은 데크로 만들 수 있다. ③ 이음부 수율을 낮추면 데크를 많이 나누는 전략이 불리해진다. (데크당 식각 수율 exp[−(AR/ARc)⁸], 비용 = 웨이퍼 비용/수율의 교육용 모델)

주변 회로를 어디에 둘 것인가: CuA와 웨이퍼 본딩

NAND 칩에는 셀 어레이 말고도 페이지 버퍼(센스 앰프+래치), 워드라인 디코더, 고전압 펌프, I/O 회로 같은 주변 회로(Peripheral Circuit)가 필요하다. 초기 3D NAND는 주변 회로를 어레이 옆에 따로 배치했는데, 어레이가 적층으로 점점 작아지자 주변 회로가 다이 면적의 30% 이상을 차지하게 되었다. 해법은 주변 회로도 “아래층”으로 보내는 것이다.

(a) 주변 회로 옆 배치 셀 어레이 CMOS 어레이 주변 회로 다이 폭 = 어레이 + 주변 (b) CuA / PUC / COP CMOS + 배선 (먼저 제작) 셀 어레이 (위에 적층) 어레이 = 다이 대부분 면적↓ · CMOS가 고온 공정을 겪음 (c) 웨이퍼 본딩 (CBA 등) 어레이 웨이퍼 (뒤집힘) CMOS 웨이퍼 (따로 제작) Cu–Cu 하이브리드 본딩 면(점선) 면적↓ · 빠른 CMOS · 웨이퍼 2장
그림 9-7. 주변 회로 배치의 세 가지 방식. (a) 옆에 두면 다이가 넓어진다. (b) CMOS를 먼저 만들고 그 위에 어레이를 쌓으면 면적이 줄지만 CMOS가 고온 공정을 견뎌야 한다. (c) 두 웨이퍼를 따로 만들어 붙이면 각각 최적 공정을 쓸 수 있다. 어레이 쪽 비트라인이 본딩 면에 오도록 어레이 웨이퍼를 뒤집어 붙인다.
본딩이 대세가 되는 이유

적층이 300단, 400단으로 올라갈수록 어레이 공정은 더 길고 뜨거워진다. CuA에서는 그 열 부담이 모두 아래 CMOS에 쌓인다. 반면 본딩은 층수가 늘어도 CMOS 쪽은 영향이 없고, 오히려 I/O 속도(3.6 Gbps 이상의 NAND 인터페이스)를 위해 더 미세한 로직 공정을 쓸 수 있다. 2023년 이후 여러 제조사가 차세대 제품에 본딩 방식을 도입하거나 도입 계획을 밝히고 있다. 또 어레이 웨이퍼를 두 장 이상 붙이는 “셀 웨이퍼 적층”도 연구되고 있다.

비트 밀도와 다이 용량 계산

3D NAND의 밀도는 세 가지 곱으로 거칠게 이해할 수 있다. 단위 면적당 채널 홀 수 × 워드라인 층 수 × 셀당 비트 수. 여기에 슬릿·더미 홀·SSL 컷 때문에 잃는 면적(어레이 효율)과, 다이에서 셀 어레이가 차지하는 비율(주변 회로·계단·패드 제외)을 곱하면 다이 밀도가 나온다.

$$\rho_{bit} \;[\mathrm{bit/mm^2}] = \frac{N_{WL}\cdot b \cdot \eta_{arr}\cdot f_{die}}{A_{hole}}, \qquad A_{hole} = \frac{\sqrt{3}}{2}\,p^2$$
여기서 \(N_{WL}\)은 데이터 워드라인 층 수, \(b\)는 셀당 비트(TLC=3, QLC=4), \(\eta_{arr}\)는 어레이 효율(슬릿·더미 손실), \(f_{die}\)는 다이 중 어레이 면적 비율, \(p\)는 육각 배열 홀 피치. 홀들은 벌집처럼 엇갈려 배치되므로 홀 하나가 차지하는 면적이 \(\frac{\sqrt3}{2}p^2\)이다.

예를 들어 \(p = 150\) nm이면 \(A_{hole} \approx 0.0195\ \mu\mathrm{m}^2\), 즉 1 µm²에 홀이 약 51개다. 236단 TLC라면 이상적인 셀 밀도는 51 × 236 × 3 ≈ 36,000 bit/µm² = 36 Gb/mm²이고, 어레이 효율 0.7과 어레이 면적 비율 0.6을 곱하면 약 15 Gb/mm²가 된다. 이는 2022~2023년 200단대 TLC 제품이 학회에서 발표한 값(대략 12~15 Gb/mm²)과 비슷한 수준이다. 이 밀도에서 1Tb 다이는 약 70 mm²다. 300단 안팎의 최신 세대는 TLC 약 20 Gb/mm², QLC는 약 28 Gb/mm²대까지 발표되었다(2024~2025년 학회 기준, 대략값).

SIMULATOR

비트 밀도·다이 용량 계산기

셀당 비트
홀 밀도—
이상적 셀 밀도—
다이 비트 밀도—
다이 용량—
1Tb에 필요한 면적—
해볼 것: ① 기본값(236단 TLC, 150 nm, η 70%, f 60%)에서 다이 밀도가 ~15 Gb/mm²인지 확인하자. ② 어레이 비율 f를 60%(주변 회로 옆)에서 85%(CuA/본딩)로 올리면 같은 단수로도 밀도가 40% 이상 오른다. ③ 단수를 두 배로 올리는 것과 QLC로 바꾸는 것의 효과를 비교해 보자. QLC는 층 수 +33%와 같은 효과지만 속도·내구성을 희생한다(8장). ④ 홀 피치를 줄이면(홀을 촘촘히) 밀도가 p²에 반비례해 오르지만 식각 난도와 셀 간 간섭이 커진다.

계단의 면적 비용

층이 늘면 계단 영역도 길어진다. 계단 한 칸의 폭을 \(w\), 층 수를 \(N\)이라 하면 계단 길이는 \(L_{st} = N w\)이고, 워드라인 길이 \(L_{WL}\) 대비 면적 오버헤드는 \(L_{st}/(L_{WL}+L_{st})\)다. 300단에 칸 폭 0.5 µm면 계단이 150 µm나 된다. 그래서 실제 칩은 계단을 워드라인 방향 한 줄로만 깎지 않고, 비트라인 방향으로도 나누어 여러 줄로 깎는 분할 계단(다방향 계단)을 써서 길이를 \(1/k\)로 줄인다.

$$L_{st} = \frac{N\, w_{step}}{k}, \qquad \text{오버헤드} = \frac{L_{st}}{L_{WL} + L_{st}}$$
\(k\)는 계단 분할 수(비트라인 방향으로 나눈 줄 수). 컨택 수는 여전히 블록당 \(N\)개이며, 컨택 깊이는 수백 nm에서 스택 전체 높이까지 다양하다.
SIMULATOR

계단 구조 면적 오버헤드

계단 분할 수 k
계단 길이—
면적 오버헤드—
블록당 WL 컨택—
최대 컨택 깊이—
해볼 것: ① k = 1(한 줄 계단)로 두고 층 수를 500까지 올려 오버헤드가 어떻게 커지는지 보자. ② k를 4, 8로 늘리면 같은 층 수에서 오버헤드가 거의 비례해 줄어든다. ③ 워드라인을 짧게 끊으면(블록을 좁게) 오버헤드 비율이 커진다. 긴 워드라인은 면적에 유리하지만 RC 지연이 커져 프로그램·읽기가 느려지는 트레이드오프다. (컨택 깊이는 워드라인 피치 45 nm 가정)

3D 고유의 신뢰성 문제

3D NAND는 평면 NAND의 셀 간 커플링 문제를 크게 줄였지만(셀 사이가 워드라인 방향으로는 산화막으로, 수평 방향으로는 홀 간격 수백 nm로 떨어져 있다), 구조 자체에서 오는 새로운 문제가 생겼다. 11장에서 ECC와 함께 자세히 다루고, 여기서는 3D 고유의 메커니즘만 짚는다.

측면 전하 이동

그림 9-2(b)에서 보았듯 차지 트랩 질화막은 한 스트링의 모든 셀에 걸쳐 끊기지 않고 이어져 있다. 프로그램된 셀의 워드라인 아래에 모인 전자들은 시간이 지나며, 특히 고온에서 질화막을 따라 위아래 워드라인 사이 공간(스페이서 영역)으로 조금씩 퍼져 나간다. 이를 측면 전하 이동(Lateral Charge Migration)이라 한다. 전하가 빠져나간 셀은 Vt가 내려가고, 이웃이 소거 상태일수록(전하 농도 차가 클수록) 이동이 심하다. 데이터 보존 직후 짧은 시간에 Vt가 빠르게 이동하는 Early Retention Loss의 주요 원인이다.

(a) 측면 전하 이동 WL n+1 (소거) WL n (프로그램) WL n−1 (소거) 질화막을 따라 전자가 퍼짐 → Vt 하강 고온·이웃 소거 상태일수록 심함 (b) 워드라인 간 간섭·홀 편차 ① 인접 WL 전계가 스페이서 영역 채널을 제어 (프린징) ② 피치↓ → 간섭↑, WL 저항↑ ③ 깊이별 홀 지름 차 → 셀 속도 차 (5절) 셀 간 거리가 막 두께로 정해짐
그림 9-8. 3D NAND 고유의 신뢰성 메커니즘. (a) 이어진 질화막을 따라 전자가 위아래로 퍼지는 측면 전하 이동. (b) 워드라인 피치가 줄면 인접 워드라인의 프린징 전계가 셀을 간섭하고, 깊이에 따른 홀 지름 차이는 셀 특성의 체계적 편차를 만든다.

워드라인 간 간섭과 기타

좋아진 점도 크다

셀이 커지고(홀 지름 ~100 nm) 셀 간 거리가 넓어진 덕분에 3D NAND TLC의 내구성(P/E 사이클 약 1k~3k회)과 신뢰성은 평면 말기 15 nm급 TLC보다 오히려 좋아졌다. 3D 전환은 밀도뿐 아니라 신뢰성 측면에서도 “한 세대 되돌린” 효과가 있었다.

핵심 정리

  1. 평면 NAND는 ~15 nm 피치에서 전자 수 부족, 셀 간 간섭, 노광 비용의 벽에 부딪혔고, 3D NAND는 스트링을 90° 세워 막 두께와 층 수로 밀도를 올린다.
  2. BiCS(2007)가 개념을, TCAT(2009)이 ON 적층 + 게이트 대체(질화막 → 텅스텐) 방식을 제시했고, 2013년 24단 양산 이후 대부분이 이 구조로 수렴했다.
  3. 셀은 워드라인 판이 채널 홀을 360° 감싸는 GAA 차지 트랩 셀이다. 게이트–블로킹–CTN–터널–폴리 채널–코어의 동심원 구조이며, 얇은 채널 + 코어 산화막이 마카로니 채널이다.
  4. 원통 구조에서는 \(E \propto 1/r\)이라 안쪽 터널막 전계가 커지고 블로킹막 전계는 작아진다. 따라서 홀 지름이 다르면 셀 속도도 다르다.
  5. 채널 홀 식각은 종횡비 수십 : 1의 HARC 공정으로 위가 넓고 아래가 좁은 테이퍼가 생긴다. 170단 이상은 더블·트리플 데크로 나누어 뚫는다.
  6. 워드라인은 계단 구조로 접근하며, 층 수 × 칸 폭 / 분할 수만큼 계단 면적이 필요하다. 슬릿은 블록 분리·게이트 대체 통로·공통 소스 역할을 겸한다.
  7. CuA/PUC/COP는 CMOS를 어레이 아래에, 웨이퍼 본딩(Xtacking·CBA)은 따로 만든 웨이퍼를 붙여 주변 회로 면적을 숨긴다. 2024~2025년 약 300단, 1Tb TLC 다이는 약 20 Gb/mm² 수준이다.
  8. 이어진 질화막을 통한 측면 전하 이동, 워드라인 간 간섭, 홀 크기 편차, 폴리 채널의 낮은 전류가 3D 고유의 신뢰성 과제다.

확인 퀴즈

1. 3D NAND에서 셀의 “크기”를 주로 결정하는 것은?

3D NAND의 셀은 워드라인 판 하나와 채널 홀 하나의 교차점이다. 세로 크기는 증착한 막 두께(워드라인 피치), 가로 크기는 홀 지름·피치가 정한다. 선폭 미세화 없이 층 수로 밀도를 올릴 수 있는 이유다.

2. 게이트 대체(Replacement Gate) 공정에서 슬릿을 통해 제거되는 층은?

ON 적층의 질화막은 워드라인 자리를 잡아 두는 희생층이다. 슬릿으로 인산을 흘려 질화막만 선택적으로 녹이고, 빈 틈에 TiN/W를 채워 저저항 금속 워드라인을 만든다. 이때 산화막 층은 채널 기둥이 받쳐 준다.

3. 원통형 GAA 셀에서 같은 게이트 전압을 걸었을 때 옳은 설명은?

원통 축전기에서 전속밀도는 \(1/r\)에 비례하므로 반지름이 작은 안쪽(터널막)에 전계가 집중된다. 프로그램이 효율적이고 블로킹막을 통한 누설·백 터널링이 줄어든다. 반지름이 작을수록 이 효과가 커진다.

4. 채널 홀이 위가 넓고 아래가 좁은 테이퍼를 가질 때, 싱글 데크 스트링에서 일반적으로 프로그램이 더 빠른 셀은?

홀 반지름이 작을수록 곡률 효과로 터널막 전계가 커지고, FN 전류가 지수적으로 늘어 프로그램·소거가 빨라진다. 그래서 워드라인 구역별로 ISPP 시작 전압 등을 따로 조정한다. 멀티 데크는 이 편차를 줄이는 효과도 있다.

5. CMOS 언더 어레이(CuA)와 비교한 웨이퍼 본딩(CBA·Xtacking) 방식의 장점으로 가장 적절한 것은?

본딩 방식은 어레이 웨이퍼와 CMOS 웨이퍼를 따로 최적 공정으로 만든 뒤 Cu–Cu 하이브리드 본딩으로 붙인다. 두 장의 웨이퍼와 본딩 정렬이 필요하다는 비용이 있지만, 주변 회로 성능과 면적 면에서 유리하다.

6. 홀 피치 150 nm(육각 배열), 200단 TLC, 어레이 효율과 어레이 면적 비율을 무시할 때 이상적인 셀 비트 밀도에 가장 가까운 값은?

\(A_{hole} = \frac{\sqrt3}{2}(0.15\,\mu m)^2 \approx 0.0195\ \mu m^2\) → 약 51 홀/µm². 51 × 200 × 3 ≈ 30,800 bit/µm² ≈ 31 Gb/mm²(1 mm² = 10⁶ µm²). 실제 다이 밀도는 여기에 어레이 효율·면적 비율이 곱해져 절반 이하가 된다.