MEMORY INDUSTRY INTELLIGENCE

AI 메모리 연구

기술을 사업의 언어로

AI는 메모리를 얼마나, 어디에 쓰게 될까요?

논문·공식 발표에서 달라지는 구조를 찾고, HBM·DRAM·NAND의 기회와 확인할 조건을 읽습니다. 어려운 수식보다 의사결정에 필요한 의미를 먼저 설명합니다.

읽는 순서쉬운 요약 → 메모리 영향 → 확인할 조건초록·공식 요약 기준 · 사업 영향은 조건부 해석
① 요청당 사용량같은 답을 만들 때 필요한 용량·데이터 이동
② 저장 위치와 역할HBM·DRAM·NAND 사이에 어떤 데이터가 이동하는지
③ 전체 사용량비용 절감 후 사용자·문맥 길이가 늘어나는지
용어가 낯설다면 · 1분 용어 설명
KV Cache
답변 생성 중 이전 입력을 다시 계산하지 않도록 저장하는 중간 기록. 모델의 학습된 지식인 ‘가중치’와 다릅니다.
HBM / Base 다이
HBM은 연산 장치 가까이 있는 빠른 메모리. Base 다이는 적층 메모리 아래에서 연결·제어를 담당하는 칩입니다.
Offloading / Data movement
연산·데이터 처리를 다른 장치에 맡기는 것 / 메모리와 장치 사이에서 데이터를 옮기는 것.
Linear Attention / SSM
긴 입력을 처리할 때 계산·기록의 증가를 줄이는 모델 구조. Mamba는 SSM을 활용합니다. 압축 프로그램을 기존 모델에 붙이는 것과 적용 조건이 다릅니다.
CXL
외부 메모리를 연결하고 여러 장치가 활용하도록 하는 연결 방식. 그 안에 들어가는 DRAM과 별도 물량으로 합산하지 않습니다.
HBF
NAND를 기반으로 대용량 데이터를 빠르게 전달하려는 메모리 계층. HBM과는 지연·쓰기 특성이 달라 용도별 검증이 필요합니다.
정기 수집 운영arXiv + Google Research·SK hynix·CXL 공식 피드 · 하루 신규 최대 12건다음 예약 10월 13일 06:15 KST · 수집 후 한국어 요약 순차 처리
최근 확인 10.12 06:18수집 완료수집 성공과 분석 완료, 실제 채택은 별개입니다.

연구와 사업 영향

요약 13건 · 분석 대기 12건

발표일이 최근인 순서입니다. 근거 수준은 확인한 자료 범위만 나타냅니다. 자동 요약은 검토 전 초안이며, 논문 실험을 상용 채택으로 표시하지 않습니다.

아키텍처·시뮬레이션 제안편집 요약2026.09.24

HBF-Sim: NAND 기반 새 계층의 실제 병목 찾기

HBF-Sim: An Extensible HBF Simulator for Large-scale GPU Memory Systems

새 메모리가 빠르다고 해도 GPU의 작은 요청을 잘 처리해야 합니다. HBF-Sim은 GPU 요청부터 NAND 내부 처리까지 연결해 병목을 살펴보는 시뮬레이터 연구입니다.

메모리 사업 해석
HBM
HBF와 HBM의 역할 분담을 평가하는 도구입니다. HBM을 같은 사양의 대용량 HBF로 교체할 수 있다는 의미는 아닙니다.
DRAM
DRAM 계층과의 실제 대체 범위는 초록에서 확인되지 않습니다.
NAND
고대역폭 NAND 스택·컨트롤러 설계의 중요성이 커집니다. 단순 NAND 용량보다 요청을 묶는 방식과 병렬성이 성능을 좌우합니다.

검토 방향HBF의 명목 대역폭보다 실제 요청 패턴에서의 성능을 확인하세요.

자세히 읽기 ↗논문 초록 · arXiv · 저자 초록
아키텍처·시뮬레이션 제안편집 요약2026.08.10

Memory Fabric: HBM끼리 데이터를 직접 전달하기

Memory Fabric: HBM Die-to-Die Interconnect for GPU Bandwidth Expansion

HBM 사이의 데이터를 옮길 때 매번 GPU를 거치면 연결이 병목이 됩니다. 이 연구는 HBM 아래 제어 칩끼리 연결하고, 데이터 이동 작업을 그곳에 맡기는 방식을 제안합니다.

메모리 사업 해석
HBM
용량 절감보다 HBM 사이의 연결·유효 대역폭을 개선하는 방향입니다. 맞춤형 Base 다이의 기능이 늘어날 수 있습니다.
DRAM
서버 DRAM으로 데이터를 옮기는 효과는 직접 확인되지 않습니다.
NAND
NAND 활용 변화의 직접 근거는 없습니다.

검토 방향HBM의 저장 용량뿐 아니라 데이터 이동을 처리하는 설계 가치도 보세요.

자세히 읽기 ↗논문 초록 · IEEE Computer Architecture Letters
표준·개발 발표편집 요약2026.08.03

HBF 표준: NAND를 AI 가까운 새 계층으로

Sandisk and SK hynix Advance Global Standardization of High Bandwidth Flash with Release of First OCP Technical Specification

AI가 쓰는 큰 데이터를 연산 장치 가까이 두기 위해 NAND 기반의 새 메모리 계층을 만들고 있습니다. Sandisk와 SK hynix의 발표는 그 연결·구현을 위한 첫 OCP 기술 규격이 나왔다는 내용입니다.

메모리 사업 해석
HBM
어떤 데이터를 HBF에 두느냐에 따라 HBM의 역할이 달라질 수 있습니다. 규격 공개만으로 HBM 주문 감소를 확정할 수 없습니다.
DRAM
DRAM과의 대체 범위·연결 조건은 이 발표 요약만으로 확인되지 않습니다.
NAND
NAND가 저장장치 외에 연산 가까운 고용량 계층으로 확장될 기회입니다. 패키징·컨트롤러·소프트웨어가 함께 필요합니다.

검토 방향새 NAND 시장의 조건을 추적하되 표준 참여와 고객 채택을 구분하세요.

자세히 읽기 ↗공식 발표 요약 · Sandisk · 공식 발표
아키텍처·시뮬레이션 제안편집 요약2026.04.28

AMMA: 메모리 가까이서 Attention 계산하기

AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving

데이터를 계속 GPU까지 옮기기보다 HBM 가까이에서 일부 Attention을 처리하자는 제안입니다. 긴 문맥에서 데이터를 읽는 시간이 큰 상황을 겨냥합니다.

메모리 사업 해석
HBM
HBM의 역할이 저장에서 가까운 연산까지 확장될 수 있습니다. HBM이 사라지는 설계로 해석하면 안 됩니다.
DRAM
서버 DRAM 대체나 이동량은 이 초록만으로 확인되지 않습니다.
NAND
NAND 역할 변화의 직접 근거는 없습니다.

검토 방향메모리 업체의 설계 가치가 커지는 조건과 실물 검증 일정을 추적하세요.

자세히 읽기 ↗논문 초록 · arXiv · 저자 초록
논문 내 실험편집 요약2026.03.24

TurboQuant: 대화 기록 압축이 서비스 비용을 바꿀까?

TurboQuant: Redefining AI efficiency with extreme compression

AI의 대화 기록을 더 적은 비트로 저장해 메모리 부담을 줄이는 연구입니다. Google의 공식 요약은 일부 장문 시험에서 기록을 크게 줄이면서 품질을 유지한 결과를 소개합니다.

메모리 사업 해석
HBM
요청당 KV 공간을 줄이면 동시 사용자·문맥 길이를 늘릴 여지가 있습니다. 전체 HBM 탑재량이 같은 비율로 줄어드는 것은 아닙니다.
DRAM
압축된 KV를 CPU에 보관할 때의 이득과 복원 비용은 별도 검증해야 합니다.
NAND
KV 압축만으로 NAND로 데이터를 이동하거나 NAND 수요가 늘어나는 것은 아닙니다.

검토 방향요청당 절감과 전체 서비스 사용량 증가를 함께 보며 HBM 전망을 점검하세요.

자세히 읽기 ↗공식 발표 요약 · Google Research · 공식 연구 요약
논문 내 실험편집 요약2025.11.25

Beluga: CXL로 큰 대화 기록을 공유하기

Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management

GPU 가까운 메모리가 부족하면 더 큰 외부 메모리가 필요합니다. Beluga는 CXL 스위치로 연결한 메모리 풀을 GPU와 CPU가 활용해 대화 기록을 관리하는 연구입니다.

메모리 사업 해석
HBM
큰 KV의 일부를 외부 풀에서 관리하면 HBM의 용량 부담을 완화할 수 있습니다. 빠른 작업 데이터까지 모두 옮길 수 있는지는 별도 문제입니다.
DRAM
외부 DRAM 풀과 연결·공유 시스템의 기회입니다. 풀링은 유휴 용량을 줄일 수도 있어 탑재량 증가만으로 단정하지 않습니다.
NAND
이 초록은 CXL 메모리 풀을 다루며 NAND 수요 증가를 직접 입증하지 않습니다.

검토 방향CXL은 연결 방식입니다. 성능과 풀 활용률을 보고 DRAM 물량을 판단하세요.

자세히 읽기 ↗논문 초록 · arXiv · 저자 초록
논문 내 실험편집 요약2025.04.28

TurboQuant 논문: 적은 비트로 기록의 정보 보존하기

TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate

대화 기록의 숫자를 짧게 적으면서도 중요한 관계를 유지하려는 연구입니다. 숫자를 먼저 회전해 압축하기 좋은 형태로 바꾸고, 남은 오차를 별도로 보정합니다.

메모리 사업 해석
HBM
KV 저장량과 이를 읽는 부담을 줄일 가능성이 있습니다. 모델 가중치나 전체 GPU 메모리의 절감률과는 다릅니다.
DRAM
KV를 다른 계층에 저장하는 경우의 전송·복원 효과는 별도 확인이 필요합니다.
NAND
NAND 수요 변화의 직접 근거는 없습니다.

검토 방향같은 품질의 요청당 비용과 동시 처리 용량을 함께 비교하세요.

자세히 읽기 ↗논문 초록 · arXiv · 저자 초록
논문 내 실험편집 요약2024.05.31

Mamba-2: 작은 상태를 유지하는 모델의 실행 개선

Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality

작은 상태로 긴 입력을 처리하는 방식도 실제 GPU에서 효율적으로 돌아가야 유용합니다. Mamba-2는 SSM과 Attention의 수학적 연결을 이용해 실행하기 좋은 구조를 설계합니다.

메모리 사업 해석
HBM
일부 장문 추론 상태의 저장 방식을 바꿀 수 있습니다. 가중치와 하이브리드 Attention의 KV까지 자동으로 줄지는 않습니다.
DRAM
CPU DRAM으로 옮기는 직접 효과는 초록에서 확인되지 않습니다.
NAND
NAND 대체·증가의 직접 근거는 없습니다.

검토 방향구조의 이론적 장점과 실제 서비스에서의 비용 개선을 따로 확인하세요.

자세히 읽기 ↗논문 초록 · arXiv · 저자 초록
논문 내 실험편집 요약2024.02.05

KIVI: 대화 기록을 낮은 정밀도로 압축하기

KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache

대화 기록의 숫자를 더 짧은 표기법으로 저장하는 연구입니다. 기록의 종류에 맞춰 압축하는 방식을 달리해, 정확도 저하를 줄이면서 메모리 사용을 낮추려 합니다.

메모리 사업 해석
HBM
KV 기록에 쓰는 바이트가 줄어 동시 요청 수를 늘릴 여지가 있습니다. 가중치와 다른 저장 공간까지 같은 비율로 줄지는 않습니다.
DRAM
KV를 CPU에 저장하는 구성에서도 적용 가능성은 있지만 이 초록만으로 효과를 확정할 수 없습니다.
NAND
NAND 역할 변화의 직접 근거는 없습니다.

검토 방향압축률보다 고객의 실제 품질·지연 조건에서 확보한 메모리 여유를 보세요.

자세히 읽기 ↗논문 초록 · arXiv · 저자 초록