AI 메모리 병목 뚫었다... KAIST 참여 ‘터보퀀트’, 최대 6배 압축
AI 성능을 좌우해온 ‘메모리 병목’이 뚫렸다. 우리 대학이 참여한 국제 공동연구팀이 최대 6배까지 메모리를 줄이면서도 성능은 유지하는 차세대 알고리즘을 공개하며, AI 산업은 물론 반도체 수요 구조까지 바꿀 기술적 전환점을 제시했다. 고용량 중심에서 고효율 중심으로 전환되면서, AI는 더 저렴해지고 빠르게 확산되는 동시에 반도체 수요 역시 질적으로 고도화될 전망이다.
우리 대전기및전자공학부 한인수 교수가 참여한 구글 리서치(Google Research), 딥마인드(DeepMind), 뉴욕대(New York University) 공동 연구팀이 인공지능(AI) 모델의 고질적인 한계로 꼽혀온 메모리 과부하 문제를 해결할 차세대 양자화 알고리즘 ‘터보퀀트(TurboQuant)’를 공개했다고 27일 밝혔다.
AI 모델은 입력 데이터를 벡터 형태로 바꾼 뒤, 벡터 간 유사도를 계산해 작동한다. 이 과정에서 고정밀(high-precision) 데이터를 사용하기 때문에 막대한 메모리 자원이 필요한 점이 주요 한계로 지적돼 왔다.
터보퀀트는 이러한 고정밀 데이터를 더 적은 비트로 압축해 표현하는 ‘양자화(quantization)’ 기술을 활용한다. 쉽게 말해, 소수점 데이터를 정수로 근사하는 방식으로, 핵심 정보는 유지하면서도 저장 용량과 연산 부담을 크게 줄이는 기술이다.
이번 연구에서 터보퀀트는 AI 모델 내부 정보를 효율적으로 압축해 정확도 저하를 거의 없이 최대 6배까지 메모리를 절감하는 데 성공했다. 특히 AI 추론 과정에서 가장 큰 장애물로 꼽히는 메모리 병목 문제를 효과적으로 해소한 점이 핵심 성과다.
터보퀀트의 핵심은 두 단계로 나누어진 양자화 구조다. 먼저 1단계에서는 입력 데이터를 무작위로 회전(Random Rotation)시킨 뒤 각 요소를 개별적으로 양자화한다. 이 과정은 데이터 내 극단값(outlier)을 줄여 압축 효율을 높이는 역할을 한다. 해당 방식은 한인수 교수가 참여한 기존 연구 ‘폴라퀀트(PolarQuant)’에서도 활용된 바 있다.
이어 2단계에서는 1단계에서 발생한 오차(residual)를 다시 한 번 양자화한다. 이때 적용되는 QJL(Quantized Johnson-Lindenstrauss) 기법은 데이터를 {-1, 1} 값만으로 표현하는 초경량(1비트) 방식으로, 정보 손실을 최소화하면서도 연산 효율을 극대화할 수 있다.
이러한 기술적 발전은 반도체 메모리 시장에도 중장기적인 활력을 불어넣을 것으로 기대된다. 단기적으로는 동일한 AI 모델을 구동하는 데 필요한 메모리 용량이 줄어들어 수요 성장이 둔화되는 것처럼 보일 수 있으나, 전문가들은 오히려 이를 'AI 대중화의 기폭제'로 보고 있다. 낮아진 메모리 문턱은 스마트폰이나 가전 등 온디바이스 AI 기기부터 대규모 데이터센터에 이르기까지 AI 적용 범위를 비약적으로 넓힐 수 있고, 결국 AI 서비스가 일상으로 확산되어 훨씬 더 큰 규모의 서비스에서 새로운 메모리 수요가 창출되는 ‘수요의 질적 고도화’와 ‘양적 팽창’이 동시에 일어날 것으로 기대한다.
특히 터보퀀트의 핵심 기술인 QJL과 폴라퀀트 연구에 KAIST 한인수 교수가 공동 연구자로 참여함으로써, 국내 연구진이 글로벌 빅테크의 핵심 AI 알고리즘 개발에 직접 기여했다는 점에서 의미가 크다.
한인수 교수는 “AI 모델의 성능이 커질수록 메모리 사용량이 급격히 증가하는 것이 가장 큰 한계로 지적되어 왔다”며, “이번 연구는 이러한 병목을 효과적으로 줄이면서도 정확도를 유지할 수 있는 새로운 방향을 제시했다”고 설명했다.
이어 “앞으로 대규모 AI 모델을 보다 효율적으로 운영할 수 있는 핵심 기반 기술로 활용될 것으로 기대한다”고 덧붙였다.
한편, 폴라퀀트 연구는 5월에 개최하는 AI와 통계(머신러닝 이론 포함)를 다루는 국제 최상위 학회인 AISTATS (Artificial Intelligence and Statistics) 2026에서 발표될 예정이며, 한국연구재단의 “기초연구실” 사업 지원 (No. RS-2024-00406715)을 받아 수행되었다.
권영진 교수팀, 구글 어워드 수상...‘실제 CPU 없이 버그 잡는다’
최신 CPU는 구조가 복잡해 여러 작업을 동시에 처리하는 과정에서 명령 순서가 뒤섞이는 ‘동시성 버그’가 발생할 수 있으며, 이는 보안 문제로까지 이어질 수 있음에도 기존 방식으로는 발견이 매우 어려웠다. 우리 대학 연구진은 실제 칩 없이도 CPU 내부 동작을 가상 환경에서 정밀하게 재현해 버그를 자동 탐지하는 기술을 세계 최초 수준으로 개발했으며, 이를 통해 최신 리눅스 커널에서 새로운 버그 11건을 찾아 수정하는 데 성공했다.
우리 대학은 전산학부 권영진 교수 연구팀이 구글이 수여하는 ‘Research Scholar Award’(시스템 분야)를 수상했다고 21일 밝혔다.
Google Research Scholar Award는 인공지능, 시스템, 보안, 데이터 관리 등 다양한 분야에서 혁신적 연구를 수행하는 신진 교수(Early-Career Professors)를 지원하기 위해 2020년부터 시행된 글로벌 연구 지원 프로그램이다.
구글 리서치 연구진이 직접 심사하며, 전 세계 수백 명 중 극소수만 선정되는 매우 경쟁적인 프로그램으로 알려져 있다. 특히 이 상은 AI·컴퓨터 시스템 분야에서 세계적으로 가장 권위 있는 산업계 연구 지원 프로그램 중 하나로 인정받고 있으며, 국내 수상 사례도 드물다.
■ 최신 Apple M3·ARM 서버에서 발생하는 동시성 버그 탐지 기술 개발
권 교수팀은 Apple M3(애플의 최신 세대 컴퓨터 프로세서 칩)와 같은 최신 ARM(전력을 적게 쓰고 효율이 높은 CPU 설계 방식) 기반 서버에서 발생하는 동시성 버그(concurrency bug)를 자동으로 탐지하는 기술을 개발했다.
동시성 버그란 CPU가 여러 작업을 동시에 처리하는 과정에서 작업 순서가 꼬여 발생하는 오류로 컴퓨터가 갑자기 멈추거나 해커가 시스템을 공격하는 통로가 될 수 있는 심각한 보안 취약점이다. 그러나 기존 테스트 방식만으로는 이러한 오류를 찾아내기 매우 어려웠다.
■ 실제 CPU 없이도 CPU 내부 동작을 재현해 버그를 자동 탐지
권 교수팀의 핵심 성과는 ‘실제 칩 없이도 CPU 내부 동작을 가상 환경에서 그대로 재현하는 기술’이다. 이 기술을 활용하면 CPU를 분해하거나 실제 칩을 사용하지 않아도 명령이 어떤 순서로 실행되는지, 어디에서 문제가 생기는지 소프트웨어만으로 정밀하게 분석할 수 있다.
이 시스템을 기반으로 리눅스 운영체제를 구동해 자동으로 버그를 탐지한 결과, 연구팀은 최신 리눅스 커널*에서 신규 버그 11개를 발견했고 이를 개발자 커뮤니티에 보고해 모두 수정되었다.
*리눅스 커널(Linux kernel): 전 세계 서버·슈퍼컴퓨터·스마트폰(안드로이드)의 기반이 되는 핵심 운영체제 엔진으로 CPU·메모리·저장장치를 모두 관리하는 시스템의 ‘심장’ 역할을 담당함
구글은 이 기술을 ‘자사 인프라에도 매우 중요한 기술’로 평가하며 해당 Award를 수여했다.
이번 기술은 리눅스뿐 아니라 안드로이드, 윈도우 등 여러 운영체제에도 적용 가능한 범용성을 지닌 것으로 평가되며, 연구팀은 소프트웨어를 오픈소스(GitHub)로 공개해 학계·산업계 누구나 활용할 수 있도록 했다.
권영진 교수는 “이번 수상은 KAIST 시스템 연구의 국제적 경쟁력을 입증한 것”이라며 “앞으로도 안전하고 신뢰성 높은 컴퓨팅 환경 구축을 위한 연구를 지속하겠다”고 말했다.
※ Google Scholar Award 수상 페이지: https://research.google/programs-and-events/research-scholar-program/recipients/
GitHub(기술 오픈소스): https://github.com/casys-kaist/ozz