Weights 140 ÷ 8 = 17.5 GB/GPU · KV 64 ÷ 8 = 8 GB/GPU. 8 GPU 비용 + NVLink 통신 overhead — 천장은 사라지지 않고 옮겨짐.
1M 컨텍스트: KV 320 GB ÷ 8 = 40 GB/GPU 여전히 가능. 10M (3.2 TB) → 16+ GPU 필요 → 비용 폭증, 천장 다시.
HBM + KV Cache · Multi-GPU09 / 16 · → Attention
Context Rot
#attention
10 / 16
메커니즘
Attention이란 무엇인가.
모든 토큰이 다른 모든 토큰을 "얼마나 봐야 하는가"를 계산하는 메커니즘입니다.
"나는 어제 강남에서 맛있는 밥을 먹었다"
"먹었다"를 이해하려면:
→ "밥을" 많이 봐야 함 (높은 attention)
→ "강남에서" 조금 봐야 함 (중간 attention)
→ "어제" 별로 안 봐야 함 (낮은 attention)
이 가중치 계산 결과가 K, V 벡터로 HBM에 저장됩니다
Context Rot · Attention10 / 16 · → 희석
Context Rot
#dilution #context-rot
11 / 16
Context Rot
길어질수록 희석된다 — 있는데 못 찾는다.
봐야 할 대상이 많아질수록 attention 가중치가 분산됩니다.
정보가 없는 게 아닙니다 — 있는데 못 찾는 겁니다.
컨텍스트 길이각 토큰 평균 attention
10 토큰 → 1/10 = 10%(집중)
1,000 토큰 → 1/1,000 = 0.1%(분산)
100,000 토큰 → 1/100,000 = 0.001%(희석)─────────────────────────
User: "아까 말한 설계 원칙대로 구현해줘"
→ 설계 원칙이 컨텍스트에 있음→ 근데 10만 토큰 중 하나→ attention이 거기까지 안 감→ 자신있게 엉뚱하게 구현
Context Rot · 희석11 / 16 · → 멘탈 모델
Mental Model vs Window
#mental-model #window
12 / 16
대비
시니어의 멘탈 모델 vs 컨텍스트 윈도우.
멘탈 모델
체화된 판단력
압축됨, 패턴화됨
즉각 인출 가능
장애 패턴 인식
트레이드오프 감각
도메인 간 연결
10년이 수 KB로 압축됨
컨텍스트 윈도우
토큰의 나열
길이 제한 있음
희석됨
매 요청마다 재구성
순서에 민감
압축 불가
경험은 토큰이 아니다
Mental Model vs Window12 / 16 · → 담을 수 없는 것
Mental Model vs Window
#tacit #intuition
13 / 16
본질
HBM에 담을 수 없는 것들.
i
암묵적 설계 감각
수백 번의 리뷰를 통해 체화된 "이건 뭔가 이상하다"의 직관
ii
반복 실패에서 나온 직관
같은 실수를 세 번 하고 나서야 생기는 패턴 인식
iii
프로젝트 전체 구조의 일관성
파일 하나가 아니라 시스템 전체를 보는 눈
iv
도메인 간 연결 능력
SSD FW 경험이 AI 추론 병목을 이해하는 데 쓰이는 것
이것들이 없으면 AI는 local에서만 똑똑하다.
Mental Model · 담을 수 없는 것13 / 16 · → 인과사슬
Closing
#causal-chain
14 / 16
정리
한계의 인과사슬.
01
컨텍스트 길어짐
대화가 쌓이고, 코드베이스가 커지고, 요청이 복잡해진다
02
KV Cache가 토큰만큼 누적된다
매 토큰마다 K·V가 쌓여 시퀀스 길이에 선형 비례 — Weights와 한 HBM을 나눠 쓴다
03
HBM 포화 → Auto-compaction
물리적 유실. 내용이 사라지는데 모델은 모른다
04
Attention 희석 → Context Rot
유실되지 않아도 못 찾는다. 있는데 못 쓰는 정보
05
멘탈 모델 대체 불가
컨텍스트 윈도우가 아무리 커져도 체화된 판단력은 못 담는다
Closing · 인과사슬14 / 16 · → 결론
Closing
#ceiling #structural
15 / 16
결론 · deck 1의 세 한계로 돌아간다
"이건 모델 업그레이드로 안 풀린다."
Limit I
Pattern Drift
명시 없는 자리는 weights의 통계 평균이 채운다.
→ weights 차원
Limit II
Context Rot
KV가 HBM을 채우면 compaction, 길어지면 attention 희석.
→ HBM 동역학
Limit III
Context Blind
HBM 용량의 천장이 컨텍스트 윈도우를 제한한다.
→ HBM 용량
Rubin GPU가 나와도, GPT-6이 나와도 — 이 구조 안에서 싸우는 한
천장의 형태는 바뀌지 않는다.
Closing · 결론15 / 16 · → Fin
Fin
#memory-wall #deck-3
16 / 16
Fin.
Memory Wall.
HBM 대역폭 · 용량 · Attention 희석 — 30년 된 한계의 최신 형태.
Rubin GPU도, GPT-6도, 이 구조 안에서는 천장을 못 깬다.
한계는 알고리즘 문제가 아니다 — 물리 문제다. 답도 그래서 알고리즘이 아니라, 시스템이다.