Chapter 04

DRAM 셀과 어레이

DRAM 비트 하나는 트랜지스터 하나와 커패시터 하나, 즉 1T1C로 끝난다. 이 단순함 덕분에 스마트폰 한 대에 수백억 개의 비트가 들어간다. 대가도 있다. 셀이 가진 전하는 수만 개의 전자뿐이고, 읽으면 지워지며, 가만히 두어도 새어 나간다. 이 장에서는 그 작은 전하를 어떻게 읽어 내는지(전하 공유와 센스 앰프), 수십억 개의 셀을 어떻게 배열하는지(오픈/폴디드 비트라인, 6F²), 그리고 10 nm대 공정에서 셀이 어떤 입체 구조가 되었는지(매립 워드라인, 실린더 커패시터)를 3D 모델로 살펴본다.

1T1C 셀: 전하 한 줌으로 비트를 저장하기

DRAM(Dynamic Random Access Memory) 셀은 액세스 트랜지스터(Access Transistor) 하나와 저장 커패시터(Storage Capacitor, \(C_s\)) 하나로 이루어진다. 트랜지스터의 게이트는 가로로 달리는 워드라인(Word Line, WL)에, 한쪽 소스/드레인은 세로로 달리는 비트라인(Bit Line, BL)에 붙는다. 반대쪽 단자에는 커패시터의 스토리지 노드(Storage Node, SN)가 연결되고, 커패시터의 다른 극판인 셀 플레이트(Cell Plate)는 모든 셀이 공유하며 보통 \(V_{DD}/2\)에 묶는다.

(a) 회로도 BL WL 게이트 D S = SN Cs 셀 플레이트 = VDD/2 액세스 Tr. (b) 단면 (매립 워드라인 + 실린더 커패시터, 개략) p형 실리콘 매립 WL 매립 WL BL (종이 면에 수직) 실린더 커패시터 (TiN / ZrO₂ / TiN) 스토리지 노드 콘택 STI 채널: WL 트렌치 바닥을 돌아감
그림 4-1. (a) 1T1C DRAM 셀의 회로. 워드라인이 트랜지스터를 켜면 비트라인과 커패시터가 연결된다. (b) 현대 DRAM 셀의 개략 단면. 두 셀이 가운데 비트라인 콘택을 공유하고, 워드라인은 실리콘 속에 묻혀 있으며, 커패시터는 트랜지스터 위로 높이 솟아 있다. 실제로는 커패시터 높이가 폭의 수십 배다(7절).

동작은 다음 세 가지다.

저장 전하는 얼마나 될까? \(C_s = 10\) fF에 \(V_{DD}/2 = 0.55\) V만큼의 차이를 저장한다면 \(Q = C\Delta V = 5.5\) fC, 전자로 약 34,000개다. 플레이트가 \(V_{DD}/2\)이므로 '1'과 '0'은 각각 \(\pm 0.55\) V의 극성으로 저장되고, 유전막에 걸리는 전압은 최대 \(V_{DD}/2\)에 그친다. 얇은 high-k 유전막의 신뢰성을 위해 플레이트를 \(V_{DD}/2\)에 두는 것이다.

SRAM과 비교하면

3장의 6T SRAM 셀은 래치가 스스로 값을 붙들어서 리프레시가 필요 없고 읽기도 비파괴적이다. 대신 트랜지스터 6개로 셀 면적이 약 120~150 F² 에 이른다. DRAM은 셀 면적 6 F² 로 20배 이상 조밀하지만, 그 대가로 센스 앰프·리프레시·복원 같은 주변 회로의 부담을 진다.

전하 공유: 작은 컵의 물을 큰 수조에 붓기

읽기의 핵심은 전하 공유(Charge Sharing)다. 비트라인은 수백 개 셀의 드레인 접합, 인접 배선과의 커플링, 센스 앰프 입력까지 전부 달고 있어서 기생 커패시턴스 \(C_{BL}\)이 셀 커패시턴스보다 훨씬 크다(보통 \(C_{BL}\)이 \(C_s\)의 5~10배). 비유하면 작은 컵(셀)의 물을 큰 수조(비트라인)에 부을 때 수조 수위가 얼마나 변하는지를 재는 일이다.

(a) WL 켜기 전 Cs VDD CBL (≈ 8 Cs) VDD/2 스위치 off (b) WL 켠 후 (평형) 스위치 on ΔV ≈ +60 mV 원래 수위 VDD/2 Cs CBL 셀 전압 급락
그림 4-2. 전하 공유의 수조 비유. 수조의 바닥 넓이는 커패시턴스, 수위는 전압, 물의 양은 전하다. 셀(좁고 수위 높음)과 비트라인(넓고 수위 \(V_{DD}/2\))을 연결하면 같은 수위로 평형을 이루는데, 비트라인이 훨씬 넓어서 수위 변화 ΔV는 수십 mV에 그친다. 반면 셀의 수위는 크게 떨어져 원래 정보가 지워진다.

전하 보존으로 평형 전압을 구해 보자. 셀 전압 \(V_{cell}\), 비트라인 프리차지 전압 \(V_{BLP} = V_{DD}/2\)에서 출발해 둘을 연결하면

$$C_s V_{cell} + C_{BL} V_{BLP} = (C_s + C_{BL})\,V_f \;\;\Rightarrow\;\; \Delta V = V_f - V_{BLP} = (V_{cell} - V_{BLP})\,\frac{C_s}{C_s + C_{BL}}$$ $$\Delta V_{'1'} = +\frac{V_{DD}}{2}\cdot\frac{C_s}{C_s+C_{BL}}, \qquad \Delta V_{'0'} = -\frac{V_{DD}}{2}\cdot\frac{C_s}{C_s+C_{BL}}$$
여기서 \(\tfrac{C_s}{C_s+C_{BL}}\)을 전하 전송비(Charge Transfer Ratio)라 한다. '1'이면 비트라인이 조금 오르고, '0'이면 조금 내린다. 부호가 곧 데이터다.

수치 예. \(V_{DD}\)(셀 어레이 전압) = 1.1 V, \(C_s = 10\) fF, \(C_{BL} = 80\) fF라면 전송비는 \(10/90 \approx 0.11\), \(\Delta V = 0.55 \times 0.11 \approx 61\) mV다. 그런데 리프레시 직전에는 누설로 '1'의 셀 전압이 이미 0.9 V 수준으로 떨어져 있을 수 있다. 그러면 \(\Delta V = (0.9-0.55)\times 0.11 \approx 39\) mV로 줄어든다. 센스 앰프 두 입력 트랜지스터의 문턱 전압 불일치(오프셋)가 보통 수~수십 mV이고, 이웃 비트라인에서 넘어오는 커플링 잡음도 있으므로 여유가 넉넉하지 않다. 그래서 DRAM 설계의 불문율이 생긴다.

Cs는 줄일 수 없다

공정이 미세해져 셀 면적이 줄어도 \(C_s\)는 대략 10 fF 안팎을 지켜야 한다. \(C_{BL}\)을 줄이려고 비트라인 하나에 붙는 셀 수를 줄이면 센스 앰프 수가 늘어 칩 면적이 커진다. 이 두 제약이 7절의 "종횡비 50:1 커패시터"라는 극단적 구조를 낳았다.

SIMULATOR

전하 공유 계산기 (수조 모형)

저장 데이터
전하 전송비—
비트라인 신호 ΔV—
셀 신호 전하—
판정—
해볼 것: ① CBL을 80→160 fF로 두 배로 늘리면(비트라인당 셀 수를 두 배로) ΔV가 거의 절반이 된다. ② '누설 후 남은 신호'를 줄여 리프레시 직전 상태를 흉내 내고, 판정이 '실패'로 바뀌는 지점을 찾자. ③ VDD를 낮추면(저전력) 같은 Cs로는 마진이 부족해진다. LPDDR 세대마다 전압을 낮추기 어려운 이유다.

비트라인 센스 앰프: 수십 mV를 풀 스윙으로

ΔV 수십 mV를 디지털 값으로 만드는 회로가 비트라인 센스 앰프(Bit-Line Sense Amplifier, BLSA)다. 구조는 3장 SRAM 셀과 같은 교차 결합 인버터 래치(Cross-Coupled Latch)다. NMOS 쌍의 공통 소스(SAN, 또는 LAB)와 PMOS 쌍의 공통 소스(SAP, 또는 LA)를 평소엔 \(V_{DD}/2\)로 띄워 두었다가, 센싱 순간 각각 0 V와 \(V_{DD}\)로 끌어당겨 래치를 깨운다. 래치의 양쪽 입력은 읽을 셀이 달린 비트라인 BL과 기준이 되는 상보 비트라인 BLB(또는 /BL)다.

BL BLB 프리차지 · 이퀄라이즈 EQ=1 → BL = BLB = VBLP = VDD/2 PMOS 래치 (P1, P2) 공통 소스 SAP: VDD/2 → VDD 높은 쪽을 VDD로 끌어올림 NMOS 래치 (N1, N2) 공통 소스 SAN: VDD/2 → 0 V 낮은 쪽을 0 V로 끌어내림 컬럼 선택(CSL) → 로컬 I/O(LIO, LIOB) 셀 WL 읽을 셀은 BL 쪽에만 연결된다 (BLB는 기준) ΔV가 초기 불균형 → 양의 되먹임으로    지수적으로 벌어짐 복원: WL이 켜진 채 BL = VDD 또는 0 V가 셀을 다시 채운다
그림 4-3. 비트라인 센스 앰프의 구성. 프리차지·이퀄라이즈 회로가 BL/BLB를 \(V_{DD}/2\)로 맞추고, PMOS·NMOS 교차 결합 래치가 ΔV를 풀 스윙(0 ↔ \(V_{DD}\))으로 증폭한다. 증폭된 값은 컬럼 선택 트랜지스터를 거쳐 로컬 I/O로 나간다. 비트라인 한 쌍마다 하나씩 있어서, 하나의 로우를 열면(ACT) 수천 개의 센스 앰프가 동시에 동작한다.

한 번의 읽기(로우 활성화) 순서를 정리하면 다음과 같다. 5장에서 배울 ACT·RD·PRE 명령과 tRCD·tRAS·tRP 타이밍이 바로 이 단계들의 소요 시간이다.

  1. 프리차지/이퀄라이즈: EQ 신호로 BL과 BLB를 단락하고 \(V_{BLP}=V_{DD}/2\)에 연결한다. 두 선이 정확히 같은 전압에서 출발해야 작은 ΔV를 비교할 수 있다.
  2. 워드라인 상승·전하 공유: EQ를 끄고 WL을 \(V_{PP}\)로 올린다. BL이 ±ΔV만큼 움직이고, BLB는 \(V_{DD}/2\)에 머문다.
  3. 센싱(증폭): ΔV가 충분히 생기면 SAN을 0 V로, 이어 SAP를 \(V_{DD}\)로 구동한다. 래치의 양의 되먹임으로 BL/BLB 차이가 지수적으로 커진다(시상수는 \(C_{BL}/g_m\) 수준).
  4. 복원: WL이 아직 켜져 있으므로 풀 스윙된 BL 전압이 셀 커패시터를 다시 \(V_{DD}\) 또는 0 V로 채운다. 이 시간이 부족하면 셀이 덜 채워져 다음 읽기의 ΔV가 줄어든다(tRAS, tWR 위반).
  5. 워드라인 하강·프리차지: WL을 끄고 센스 앰프를 끈 뒤, 다시 EQ로 BL/BLB를 \(V_{DD}/2\)로 되돌린다. 0 V와 \(V_{DD}\)인 두 선을 단락하면 전하가 나뉘어 저절로 \(V_{DD}/2\)가 되므로 에너지 효율이 좋다. 이것이 \(V_{DD}/2\) 프리차지의 또 다른 장점이다.
SIMULATOR

센스 앰프 동작 파형 (단계별)

저장 데이터
단계 이동
현재 단계—
BL / BLB—
셀 전압—
복원 후 셀—
해볼 것: ① '다음 ▶'으로 한 단계씩 넘기며 셀 전압(점선)이 전하 공유 순간 \(V_{DD}/2\) 근처로 떨어졌다가 복원 구간에서 되살아나는 것을 확인하자(파괴적 읽기 + 복원). ② 복원 시간을 0.3 이하로 줄이면 WL이 닫힐 때 셀이 덜 채워진다(‘복원 후 셀’ 값). ③ 전송비를 낮추면 SA를 켜기 전 ΔV가 작아져, 증폭이 느리게 시작하는 것이 보인다. (전압 단위 V, VDD = 1.1 V, VPP = 2.9 V는 눈금을 줄여 표시, 교육용 모형.)
오프셋 보상 센스 앰프

미세 공정에서는 두 입력 트랜지스터의 문턱 전압 편차가 ΔV에 견줄 만큼 커졌다. 그래서 최근 DRAM은 센싱 전에 각 트랜지스터의 오프셋을 비트라인에 미리 저장해 상쇄하는 오프셋 보상(Offset-Cancellation) BLSA나, 셀 전하를 보다 작은 커패시턴스의 노드로 옮겨 신호를 키우는 전하 전송형 사전 감지 방식 등을 연구·채택하고 있다. 원리는 모두 같다. "ΔV가 오프셋보다 확실히 커야 한다."

어레이 구조: 오픈 vs 폴디드 비트라인, 8F²와 6F²

셀 면적은 최소 선폭 \(F\)(Feature Size, 대략 워드라인·비트라인의 하프 피치)의 제곱 단위로 잰다. 워드라인 피치가 \(2F\), 비트라인 피치가 \(2F\)인 격자라면 교차점 하나의 면적은 \(4F^2\)가 이론적 한계다. 실제 DRAM은 센스 앰프가 BL과 BLB를 어떻게 짝짓느냐에 따라 두 가지 배치로 갈린다.

(a) 폴디드 비트라인 · 8F² 셀 1개 = 2F × 4F SA BL과 BLB가 같은 어레이에서 나란히 → 잡음 상쇄 빈 교차점 위로 패싱 WL이 지나감 (b) 오픈 비트라인 · 6F² 2F × 3F 모든 교차점에 셀 → 면적 25% 절감 BLB는 SA 반대편 매트에서 가져옴 → 잡음 불리 (실제 6F² 셀은 활성영역이 비스듬히 기울어진 배치, 5절 3D 모델 참조)
그림 4-4. 셀 배치 비교(개념도). (a) 폴디드 구조는 교차점의 절반에만 셀이 있어 \(8F^2\). (b) 오픈 구조는 모든 교차점을 쓰므로 \(6F^2\). 오픈 구조에서 비트라인 피치가 \(2F\)가 아니라 \(3F\)인 것은, 기울어진 활성영역과 스토리지 노드 콘택을 비트라인 사이에 넣을 공간이 필요하기 때문이다.
SIMULATOR

오픈 vs 폴디드 비트라인: 면적과 잡음

배치
셀 면적—
BL 잡음 / BLB 잡음—
차동 잡음—
유효 센싱 마진—
해볼 것: ① 두 배치를 번갈아 선택하며 같은 WL을 켰을 때 셀이 열리는 비트라인(빨강)과 기준 비트라인(회색 점선)의 위치를 비교하자. ② 잡음을 30 mV 이상으로 키우면 폴디드는 공통 모드로 대부분 상쇄되지만, 오픈은 잡음이 거의 그대로 마진을 깎는다. ③ 그런데도 업계가 오픈을 택한 이유는 ‘셀 면적’ 값에 있다. (잡음 모형: 폴디드는 BL·BLB 잡음 불일치 약 10%, 오픈은 약 70% 가정.)

서브어레이, 매트, 계층형 비트라인

16 Gb 칩을 하나의 거대한 격자로 만들 수는 없다. 워드라인은 길어질수록 RC 지연이 커지고, 비트라인은 셀이 많이 붙을수록 \(C_{BL}\)이 커져 ΔV가 줄기 때문이다. 그래서 어레이를 작은 타일로 쪼갠다.

칩 → 뱅크 주변회로 · I/O · 패드 뱅크 DDR5: 32뱅크 (8 그룹) 뱅크 → 매트 타일 ■ SA 스트라이프   ■ 서브 WL 드라이버 매트 1개 (예: 512×512) 로컬 BL → BLSA CSL → LIO → MIO(글로벌) 서브 WL 드라이버가 로컬 WL 구동, 메인 WL(금속)이 여러 매트를 관통 로우 디코더: 로우 주소 → 메인 WL + 서브 WL 선택 신호(PXI) 컬럼 디코더: 컬럼 주소 → CSL (한 번에 8~16개 SA를 I/O에 연결)
그림 4-5. DRAM 어레이의 계층. 뱅크는 수백 개의 매트(서브어레이)로 나뉘고, 매트 사이 가로 띠에는 비트라인 센스 앰프가, 세로 띠에는 서브 워드라인 드라이버가 놓인다. 매트 크기(비트라인당·로컬 워드라인당 셀 수)는 제품마다 다르며 대표적으로 512~1024 수준이다.

한 번의 ACT로 열리는 로우 하나를 페이지(Page)라 부르고, DDR5 ×8 칩의 페이지 크기는 1 KB(8,192개 센스 앰프)다. 한 로우를 열면 이 수천 개의 셀이 모두 전하 공유·증폭·복원을 겪는다. 그중 실제로 읽어 가는 것은 버스트 한 번에 수십 비트뿐이라는 점이 DRAM 에너지의 큰 비효율이자, 5장의 로우 버퍼 지역성이 중요한 이유다.

3D로 보는 6F² 셀 어레이

그림 4-4의 격자는 개념도일 뿐이다. 실제 10 nm대 DRAM 셀은 여러 층이 입체적으로 얽혀 있다. 아래 모델은 워드라인 8개 × 비트라인 4개, 셀 32개로 이루어진 6F² 어레이의 개략 구조다(1 칸 = F, 높이 방향은 보기 좋게 줄였다). 아래에서부터 쌓이는 순서대로 층을 켜고 끄고, 분해도 슬라이더로 층을 벌려 보자. 커패시터를 클릭하거나 WL·BL 슬라이더를 움직이면 해당 셀과 그 셀을 여닫는 워드라인, 데이터를 나르는 비트라인이 강조된다.

3D

DRAM 셀 어레이 모델 (매립 WL · 비트라인 · 실린더 커패시터)

드래그 회전 · 휠/핀치 확대 · 커패시터 클릭
층 표시
선택 셀—
BL 콘택 공유 셀—
셀 면적—
표시 종횡비 H/D—
해볼 것: ① 분해도를 60% 이상으로 올려 매립 워드라인이 실리콘 속에서 빠져나오는 것을 보고, 워드라인이 실리콘 표면보다 아래에 있다는 점을 확인하자. ② ‘커패시터’와 ‘서포터’를 끄면 기울어진 활성영역 하나에 셀 두 개가 가운데 비트라인 콘택을 공유하는 구조가 드러난다. ③ WL 슬라이더를 한 칸씩 움직이면 같은 비트라인의 셀이 번갈아 위·아래 줄로 바뀐다. 활성영역이 기울어진 이유다. ④ 커패시터 높이를 12로 올려 보자. 실제 제품의 종횡비는 이보다도 훨씬 크다(7절). (실제 치수 비율이 아닌 개략 모형이며, 제조사마다 배치가 다르다.)

모델의 층을 아래에서부터 정리하면 다음과 같다. 재료와 치수는 2020년대 제품에서 공개적으로 알려진 대표적 구성이며 제조사마다 다르다.

층대표 재료역할과 특징
활성영역 · STI
(Active, Shallow Trench Isolation)
단결정 Si / SiO₂·SiN 채움비스듬히 기울어진 막대 모양 활성영역 하나에 셀 2개. 가운데가 비트라인 콘택, 양 끝이 스토리지 노드
매립 워드라인
(Buried Word Line, BWL)
TiN/W (최근 TiN + 도핑 폴리 이중 일함수 등)실리콘 트렌치 아래쪽에 묻힌 게이트. 위는 질화막 캡으로 덮여 표면이 평평
비트라인 콘택 (DC)
(Direct Contact)
도핑 폴리 Si활성영역 가운데와 비트라인을 연결
비트라인
(Bit Line)
W (배리어 TiN) + SiN 캡·스페이서워드라인과 직교. 스페이서를 공기층(air spacer)으로 바꿔 커플링과 \(C_{BL}\)을 줄이는 기술이 쓰인다
매몰 콘택 (BC)
(Buried Contact, SNC)
폴리 Si비트라인 사이 좁은 틈으로 스토리지 노드를 끌어올림. 저항이 셀 쓰기 속도(tWR)를 좌우
랜딩 패드
(Landing Pad, LP)
W콘택 위치를 커패시터의 조밀 배열(육방 격자) 위치로 옮겨 주는 받침
커패시터 하부 전극TiN실린더 또는 필라 모양. 높이 1 µm 이상, 폭 수십 nm
서포터
(Supporter, MESH)
SiN키 큰 전극이 쓰러지거나 서로 붙지 않도록 중간·위를 그물처럼 잡아 줌
유전막 · 상부 전극ZrO₂/Al₂O₃/ZrO₂ (ZAZ) · TiN + SiGe셀 전체가 공유하는 플레이트(\(V_{DD}/2\))
왜 활성영역이 기울어져 있을까

6F² 셀에서 비트라인 피치는 3F다. 활성영역이 비트라인과 나란하면 스토리지 노드가 비트라인 바로 아래에 오게 되어 콘택을 뽑을 수 없다. 활성영역을 약 20° 안팎으로 기울이면 가운데(비트라인 콘택)는 비트라인 아래, 양 끝(스토리지 노드)은 비트라인과 비트라인 사이에 놓인다. 이 한 가지 기하학적 묘수로 모든 WL–BL 교차점에 셀을 둘 수 있게 되었다.

셀 트랜지스터의 진화: 평면에서 매립 워드라인까지

액세스 트랜지스터에 대한 요구는 로직 트랜지스터와 정반대다. 속도보다 꺼져 있을 때 누설이 극도로 작아야 한다. 10 fF 커패시터가 64 ms 동안 수백 mV를 지키려면 누설 전류가 대략 fA(10⁻¹⁵ A) 수준이어야 한다. 그런데 셀 면적이 줄면 게이트 길이도 줄고, 짧은 채널 효과로 문턱 전압이 떨어지고 누설이 늘어난다. 이를 막으려고 채널을 아래로 '접어' 넣는 방향으로 진화했다.

① 평면형 WL (폴리) 채널 ≈ F ~90 nm 이전 짧은 채널 누설 ↑ ② RCAT (리세스 채널) WL (폴리, 표면 위로 돌출) U자 채널: 길이 ↑ ~2005년 전후 (90~50 nm급) 누설 ↓, 게이트 커플링 ↑ ③ BCAT (매립 WL) SiN 캡 표면이 평평 → 콘택·BL 공간 확보 TiN/W 게이트 ~2010년 전후 (40 nm급~) WL 저항 ↓, BL 커플링 ↓ ④ 새들 핀 (WL 방향 단면) Si 핀 STI 게이트가 핀 옆면까지 감쌈 매립 WL + 핀 결합 (최근) 구동 전류 ↑, 제어력 ↑
그림 4-6. 셀 트랜지스터의 진화(개략, 연도는 업계 대략값). ① 평면형은 채널 길이가 셀 크기에 묶인다. ② RCAT은 게이트를 실리콘 속으로 파고들게 해 같은 면적에서 채널을 길게 만들었다. ③ BCAT은 게이트 전체를 트렌치 아래에 묻어 표면 위 공간을 비트라인과 콘택에 내주었다. ④ 최근에는 채널 부분의 STI를 살짝 깎아 게이트가 핀의 옆면까지 감싸는 새들 핀을 결합해 구동 전류를 확보한다.

RCAT(Recess Channel Array Transistor)은 채널을 U자로 만들어 유효 채널 길이를 늘린 첫 번째 3차원 셀 트랜지스터다. 하지만 게이트가 표면 위로 솟아 있어 비트라인·콘택과 겹치는 기생 커패시턴스가 컸다. BCAT(Buried Channel Array Transistor), 즉 매립 워드라인 구조는 게이트 금속(TiN/W)을 트렌치 아래쪽에만 채우고 위는 질화막으로 덮었다. 효과는 세 가지다.

GIDL과 로우 해머

매립 워드라인 셀의 약점도 있다. 꺼진 게이트와 스토리지 노드 n⁺ 영역이 겹치는 곳에 강한 전계가 걸려 GIDL(Gate-Induced Drain Leakage)이 생기므로, 게이트 금속 윗부분의 높이와 일함수를 정밀하게 조절한다(이중 일함수 WL). 또 워드라인이 이웃 셀의 활성영역 옆을 지나가며(패싱 게이트) 반복 활성화 시 이웃 셀의 전하를 빼앗는 로우 해머(Row Hammer) 현상이 셀 간격이 좁아질수록 심해진다. 이 신뢰성 문제와 대책(TRR, RFM, PRAC)은 11장에서 다룬다.

커패시터의 진화: 좁은 땅에 초고층 빌딩 짓기

셀 면적이 \(6F^2\)로 줄어도 \(C_s\)는 10 fF 안팎을 유지해야 한다. 평행판 커패시터 \(C = \varepsilon_0 k A / t\)에서 쓸 수 있는 방법은 세 가지뿐이다. 면적 \(A\)를 늘리거나(높이 쌓기), 유전율 \(k\)를 높이거나(high-k), 두께 \(t\)를 줄이는 것(누설 증가로 한계). DRAM 커패시터의 역사는 이 세 가지를 모두 극한까지 밀어붙인 기록이다.

① 스택 (초기) 넓적한 전극 + 핀·주름 1980~90년대 ② 트렌치 기판 속으로 깊게 팜 ~2000년대 (일부 업체), 이후 퇴장 ③ 실린더 (OCS) 안 밖 안·밖 두 면 사용 2000년대 ~ 20 nm급 ④ 필라 + 서포터 MESH 10 nm대: 바깥 면만, 종횡비 ↑
그림 4-7. DRAM 커패시터 구조의 진화(개략). ① 초기 스택형은 트랜지스터 위에 넓적한 전극을 얹었다. ② 트렌치형은 기판 속으로 깊게 팠으나 고종횡비 식각과 공정 복잡도 문제로 주류에서 밀려났다. ③ 실린더형(One-Cylinder Storage)은 컵 모양 전극의 안팎을 모두 쓴다. ④ 셀 피치가 너무 좁아지자 컵 안쪽에 유전막과 상부 전극을 넣을 공간이 사라져, 속이 찬 기둥(필라)의 바깥 면만 쓰게 되었다. 키 큰 기둥을 SiN 서포터가 그물처럼 잡아 준다.

원통 전극의 표면적은 \(\pi D H\)다. \(D = 30\) nm, \(H = 1.2\) µm(종횡비 40)이면 한 면이 약 \(1.1\times10^{-13}\) m²이다. 등가 산화막 두께(EOT) 0.6 nm 수준의 ZrO₂계 유전막이라면 \(C = \varepsilon_0 (3.9) A / \text{EOT} \approx 6.5\) fF 정도가 나온다. 목표를 채우려면 더 높이 쌓거나, 유전막을 더 얇게, 더 높은 \(k\)로 만들어야 한다. 이 때문에 최신 공정의 커패시터 종횡비는 대략 40~60:1, 공개 보도 기준으로 50:1 이상까지 거론된다(2024년 전후).

$$C_s = \frac{\varepsilon_0 k\, A}{t} = \frac{\varepsilon_0 \cdot 3.9 \cdot A}{\text{EOT}}, \qquad A_\text{pillar} \approx \pi D H, \qquad A_\text{cyl} \approx \pi (D + D_i) H$$
\(\text{EOT} = t \cdot 3.9/k\)는 같은 커패시턴스를 내는 SiO₂ 두께다. \(D_i\)는 실린더 안쪽 지름(바깥 지름에서 전극 두께를 뺀 값). \(t \ll D\)일 때 원통 곡률은 무시해도 된다.
유전체유전율 k (대략)밴드갭 (eV)DRAM에서의 쓰임
SiO₂3.9~9초기 ONO(산화-질화-산화) 유전막
Si₃N₄~7~5.3ONO/NO 유전막 (1990년대)
Al₂O₃~9~8.8누설 차단층 (ZAZ의 가운데 층)
HfO₂~20~5.82000년대 중반 high-k 도입기
ZrO₂ (정방정)~35–45~5.8현재 주력. ZrO₂/Al₂O₃/ZrO₂ 적층
TiO₂, SrTiO₃80~200+~3.2차세대 후보. 밴드갭이 작아 누설 제어가 과제

k가 높은 물질일수록 대체로 밴드갭이 작아 누설 전류가 커진다. ZrO₂ 사이에 얇은 Al₂O₃를 끼운 ZAZ 구조는 높은 유전율과 낮은 누설을 절충한 결과다. 유전막은 수십 nm 폭, 1 µm 넘는 깊이의 구멍 속 벽면에 원자 한 층씩 균일하게 입혀야 하므로 원자층 증착(ALD, Atomic Layer Deposition)이 필수다.

SIMULATOR

커패시터 설계 계산기

구조
유전체
셀 커패시턴스 Cs—
종횡비 H/D—
EOT—
ΔV (VDD=1.1 V)—
해볼 것: ① 실린더에서 D를 40 → 25 nm로 줄여 보자. 안쪽 구멍이 유전막과 상부 전극으로 막히는 순간 안쪽 면을 쓸 수 없게 되어 Cs가 급감한다. 필라 구조가 등장한 이유다. ② 필라, D = 30 nm에서 Cs 10 fF를 얻으려면 H가 얼마여야 하는지, 그때의 종횡비를 확인하자. ③ 유전체를 SiO₂로 바꾸면 같은 크기에서 Cs가 1/10로 준다. high-k 없이는 현대 DRAM이 불가능하다. (전극 두께 4 nm, 평행판 근사, 교육용 모형.)
종횡비 50:1이란

지름 30 nm, 높이 1.5 µm인 구멍은 지름 1 m, 깊이 50 m인 우물과 비율이 같다. 이런 구멍 수십억 개를 웨이퍼 전체에 똑같은 모양으로 뚫어야 한다(몰드 식각). 식각 후에는 전극이 서로 기대어 붙는 리닝(Leaning)과 쓰러짐을 막기 위해 SiN 서포터를 1~3층 넣는다. 서포터에 구멍을 뚫어 그 아래 몰드 산화막을 습식으로 녹여 내고, 드러난 전극 바깥면에 유전막을 입힌다.

스케일링의 난제와 미래: 1c nm, EUV, 4F², 3D DRAM

2010년대 중반 20 nm 벽을 넘은 뒤 DRAM 업계는 공정 세대를 숫자 대신 1x, 1y, 1z, 1a, 1b, 1c(10 nm대 1~6세대)로 부른다. 세대마다 셀 면적은 대략 10~20%씩 줄지만, 줄어드는 폭은 점점 작아지고 비용은 커진다. 세대 이름은 특정 치수를 가리키지 않으며, 실제 비트라인·워드라인 하프 피치는 이름보다 크다.

세대양산 시작 (대략)주요 기술 변화
1x2016년 전후20 nm 미만 진입, ArF 액침 + 다중 패터닝(SAQP)
1y / 1z2018~2020년셀 면적 추가 축소, 에어 스페이서·고유전 공정 고도화
1a2021년 전후일부 업체 EUV 첫 양산 적용(수 개 층)
1b2022~2023년EUV 적용 층 확대(업체별 상이), HKMG 주변 회로 확대
1c2024~2025년EUV 확대, 커패시터·BL 공정 난도 급증
0a 이후(예상)2027년 이후4F² 수직 채널 셀, 3D DRAM 등 구조 전환 논의

평면 스케일링을 가로막는 벽은 여러 겹이다. 패턴 측면에서는 활성영역·비트라인·스토리지 노드를 수 nm 오차로 정렬해야 하고, ArF 다중 패터닝의 단계 수가 폭증해 EUV를 도입했다(Micron은 1γ 세대부터 EUV를 쓰기로 해 도입 시점이 업체마다 다르다). 전기적으로는 셀 트랜지스터 누설, 콘택 저항 증가로 인한 쓰기 속도 저하, 비트라인 커플링, 로우 해머가 동시에 악화된다. 가장 큰 벽은 앞 절에서 본 커패시터다. 지름이 줄면 같은 \(C_s\)를 위해 더 높이 쌓아야 하고, 종횡비는 식각과 구조 안정성의 한계에 다가간다.

(a) 4F² VCT (수직 채널 트랜지스터) 매립 BL (아래) WL (채널 옆면 감쌈) 커패시터 (위) 채널이 수직 → 셀 = 2F × 2F, 트랜지스터·BL·커패시터를 위아래로 분리 (b) 3D DRAM (셀을 옆으로 눕혀 적층) 수직 BL 가로로 누운 커패시터 WL 층 수 ↑ = 밀도 ↑
그림 4-8. 평면 6F² 이후의 후보(개념도). (a) 4F² VCT: 실리콘 기둥을 세로 채널로 쓰고, 비트라인을 아래에, 커패시터를 위에 둔다. 워드라인은 기둥의 옆면을 감싼다. 셀 면적이 이론적 최소인 \(4F^2\)가 된다. (b) 3D DRAM: 3D NAND(9장)처럼 셀을 옆으로 눕혀 층층이 쌓는다. 비트라인이 수직으로 층들을 관통하고, 각 층에 가로 트랜지스터와 가로 커패시터가 놓인다. 두 방식 모두 2024~2026년 현재 연구·개발 단계다.
SIMULATOR

셀 크기 스케일링과 비트 밀도

셀 구조
다이 용량
셀 면적—
어레이 밀도—
다이 밀도—
예상 다이 면적—
해볼 것: ① F = 18 nm, 6F², 효율 55%에서 16 Gb 다이 면적을 확인하자. 셀 면적이 약 0.002 µm²로, 2020년대 초 제품의 공개 분석값과 비슷한 수준이다. ② 같은 F에서 6F² → 4F²로 바꾸면 밀도가 정확히 1.5배가 된다. F를 18 → 15 nm로 줄이는 것(약 1.44배)보다 효과가 크다. ③ 셀 어레이 효율은 센스 앰프·서브 WL 드라이버·주변 회로가 차지하는 면적에 달려 있다. 매트를 작게 쪼갤수록 ΔV는 좋아지지만 효율은 나빠진다. (다이 면적 = 용량 ÷ (어레이 밀도 × 효율), 교육용 근사.)
F² 단위로 생각하기

셀 면적을 F² 단위로 말하면 공정 세대와 무관하게 셀 구조의 효율을 비교할 수 있다. SRAM 6T ≈ 120~150F², NOR 플래시 ≈ 10F², DRAM 6F², 평면 NAND 4F²(셀당, 다중 비트 전 기준). 3D NAND는 층을 쌓아 유효 셀 면적이 1F²보다 훨씬 작아졌고, DRAM이 3D를 고민하는 이유도 여기에 있다.

핵심 정리

  1. DRAM 셀은 액세스 트랜지스터와 커패시터 하나(1T1C)로, 워드라인이 트랜지스터를 켜면 비트라인과 커패시터가 연결된다. 셀 플레이트는 \(V_{DD}/2\), 워드라인은 \(V_{PP}\)로 구동한다.
  2. 읽기는 전하 공유다. \(\Delta V = \pm\tfrac{V_{DD}}{2}\cdot\tfrac{C_s}{C_s+C_{BL}}\)으로, \(C_s \approx 10\) fF, \(C_{BL} \approx 80\) fF이면 ΔV는 수십 mV에 불과하다. 누설로 셀 전압이 떨어지면 더 작아진다.
  3. 교차 결합 래치형 비트라인 센스 앰프는 프리차지(\(V_{DD}/2\)) → WL 상승·전하 공유 → 증폭 → 복원 → 프리차지 순으로 동작한다. 읽기는 파괴적이고 복원이 읽기의 일부다.
  4. 폴디드 비트라인(8F²)은 잡음에 강하고, 오픈 비트라인(6F²)은 면적이 25% 작다. 현재 DRAM은 6F² 오픈 비트라인과 기울어진 활성영역을 쓴다.
  5. 어레이는 매트(서브어레이)로 쪼개고 SA 스트라이프·서브 WL 드라이버·로컬/글로벌 I/O로 계층화해 \(C_{BL}\)과 WL 지연을 제한한다.
  6. 셀 트랜지스터는 누설을 줄이기 위해 평면 → RCAT → 매립 워드라인(BCAT) → 새들 핀으로 진화했다. 매립 WL은 WL–BL 커플링을 줄이고 표면 공간을 확보했다.
  7. 커패시터는 스택/트렌치 → 실린더 → 필라로 진화하며 종횡비 40~60:1, ZrO₂계 high-k와 ALD, SiN 서포터로 10 fF 안팎을 지킨다.
  8. 1a/1b/1c 세대는 EUV와 공정 고도화로 버티고 있으며, 그다음은 4F² 수직 채널 셀과 3D DRAM 같은 구조 전환이 논의된다.

확인 퀴즈

1. \(V_{DD} = 1.2\) V, \(C_s = 12\) fF, \(C_{BL} = 108\) fF인 셀에서 '0'을 읽을 때 비트라인 신호 ΔV는?

전송비 = 12/(12+108) = 0.1. ΔV = −(1.2/2) × 0.1 = −60 mV. '0'은 셀 전압(0 V)이 프리차지 전압(0.6 V)보다 낮으므로 비트라인이 내려간다.

2. DRAM 읽기가 '파괴적'이라고 하는 이유로 가장 알맞은 것은?

\(C_{BL} \gg C_s\)라서 전하 공유 후 셀 전압은 \(V_{DD}/2 \pm \Delta V\) 근처가 된다. 원래 정보는 센스 앰프 래치에만 남으므로, WL이 켜진 동안 증폭된 비트라인 전압으로 셀을 다시 채우는 복원이 필요하다.

3. 오픈 비트라인(6F²) 구조가 폴디드 비트라인(8F²)보다 불리한 점은?

폴디드는 BL과 BLB가 같은 어레이에서 나란히 달려 워드라인·기판 잡음이 두 선에 같이 실리고 차동 증폭에서 상쇄된다. 오픈은 기준선이 센스 앰프 반대편 매트에 있어 잡음이 차동 성분으로 남는다. 대신 면적이 25% 작다.

4. 매립 워드라인(BCAT)의 장점이 아닌 것은?

매립 WL에서도 게이트와 스토리지 노드 접합이 겹치는 부분의 GIDL은 중요한 누설원이며, 셀 간격이 좁아지면서 로우 해머는 오히려 심해졌다. 이중 일함수 WL, TRR·RFM 같은 대책이 필요하다(11장).

5. 셀 피치가 줄면서 커패시터가 실린더형에서 필라형으로 바뀐 주된 이유는?

실린더는 안팎 두 면을 써서 같은 크기라면 커패시턴스가 더 크다. 하지만 지름이 20~30 nm대로 줄면 전극 두께 + 유전막 두께 × 2 + 상부 전극을 안쪽에 넣을 수 없게 된다. 그래서 속이 찬 기둥의 바깥 면만 쓰고, 부족한 면적을 높이(종횡비)로 메운다.

6. F가 같을 때 6F² 셀을 4F² 수직 채널 셀로 바꾸면 셀 어레이 밀도는 몇 배가 되는가?

셀 면적 비 6/4 = 1.5. 한 세대 공정 미세화(셀 면적 10~20% 감소)보다 훨씬 큰 효과라서, 공정 미세화가 어려워진 지금 4F² VCT가 유력한 다음 단계로 거론된다.