AI가 '안 들리는데 들린다' 우기는 시대 끝낸다
AI가 ‘안 들리는데 들린다’, ‘없는데 있다’고 우기는 시대가 끝난다. 우리 대학 연구진이 AI가 여러 감각 정보를 스스로 구분하고 존재하지 않는 정보를 만들어내는 ‘환각’을 줄이는 핵심 기술을 개발했다. 자율주행차와 로봇, 의료 AI 등 실제 산업 현장에서 더욱 신뢰할 수 있는 멀티모달 AI 구현의 기반이 될 것으로 기대된다.
우리 대학은 전기및전자공학부 노용만 교수 연구팀이 멀티모달 대형 언어모델(MLLM, 텍스트와 이미지·소리 등 여러 정보를 함께 이해하는 AI)의 감각 혼선을 줄이는 두 가지 핵심 기술을 개발했다고 31일 밝혔다. 이번 기술은 카메라와 다양한 센서의 특성을 정확히 이해하도록 하는 기술과 시각·청각 정보가 뒤섞이면서 발생하는 환각을 줄이는 기술로, 별도의 대규모 재학습 없이도 AI의 신뢰성을 크게 높였다.
연구팀이 개발한 첫 번째 기술은 AI가 열화상(Thermal, 물체가 내는 열을 영상으로 보여주는 센서), 깊이 영상(Depth, 물체까지의 거리를 측정하는 센서), 엑스레이(X-ray) 등 다양한 센서가 담고 있는 물리적 의미를 정확하게 이해하도록 돕는 ‘센서 이해 AI’기술(DNA, Diverse Negative Attributes) 최적화 기법이다.
사람은 열화상 화면에서 밝게 보이는 부분이 ‘뜨거운 곳’이라는 것을 알지만, 기존 AI는 이를 일반 사진처럼 해석해 단순한 빛으로 착각하기도 했다. 연구팀은 AI가 열과 거리 등 센서가 측정하는 물리 정보를 이해하도록 새로운 학습 기술을 개발했다. AI가 자주 틀리는 사례를 반복적으로 학습하게 한 결과, 어둠이나 연기 속에서도 사물을 더욱 정확하게 인식할 수 있게 됐다.
두 번째 기술은 시각과 청각 정보가 서로 영향을 주면서 발생하는 환각을 줄이는 ‘감각 혼선 방지' 기술(MAD, Modality-Adaptive Decoding) 기술이다.
예를 들어 CCTV 영상에 자동차가 지나가는 장면이 담겨 있지만 실제로는 소리가 녹음되지 않았을 때, 기존 멀티모달 AI는 자동차가 보인다는 이유만으로‘엔진 소리가 들린다’고 답하는 경우가 있었다. 연구팀은 AI가 먼저 ‘이번 질문은 영상을 보고 판단해야 하는지, 소리를 듣고 판단해야 하는지’를 스스로 구분한 뒤, 더 중요한 감각 정보에 집중하도록 만들었다. 이를 통해 AI를 처음부터 다시 학습시키지 않고도(Training-free) 이러한 감각 혼선과 환각을 효과적으로 줄였다.
또한 연구팀은 AI를 막대한 컴퓨팅 자원으로 처음부터 다시 학습시키는 대신, DNA 기술은 적은 데이터만으로 다양한 센서를 이해하도록 성능을 높이고, ‘감각 혼선 방지' 기술(MAD)은 기존 AI에 프로그램을 추가하듯 바로 적용할 수 있도록 설계했다. 따라서 시간과 비용을 크게 줄이면서도 기존 멀티모달 AI의 신뢰성을 높일 수 있어 산업 현장에 빠르게 적용할 수 있다.
이번 기술은 밤이나 안개 속에서도 보행자와 차량을 정확히 인식해야 하는 자율주행차, 연기로 앞이 보이지 않는 화재 현장에서 생존자를 찾는 구조 로봇, 열화상 카메라를 이용하는 드론 등에 활용될 수 있다. 또한 공항 보안검색에서 엑스레이 영상을 분석하거나, 병원에서 CT·MRI·엑스레이 등 여러 의료영상을 함께 분석하는 AI의 정확성과 신뢰성을 높이는 데도 기여할 것으로 기대된다.
노용만 교수는 "멀티모달 AI가 실제 환경에서 사용되기 위해서는 다양한 센서의 특성을 정확히 이해하고 여러 감각 정보를 혼동하지 않는 것이 중요하다”며 "이번 연구는 대규모 재학습 없이도 AI의 감각 편향과 환각을 줄여 실제 생활과 산업 현장에서 믿고 사용할 수 있는 멀티모달 AI의 기반을 마련했다”고 말했다.
이번 성과는 KAIST 전기및전자공학부 정상윤 박사과정이 두 기술 연구 모두 제1 저자로 참여해 연속성을 빛냈으며, 유영준 박사가 ‘센서 이해 AI' 기술(DNA) 연구에 공동 제1 저자로 참여했다.
관련 논문 중 ‘감각 혼선 방지' 기술(MAD) 연구는 인공지능 컴퓨터 비전 분야 최고 권위 국제학회인 ‘국제 컴퓨터 비전 및 패턴인식 학술대회(CVPR)’에 지난 6월 발표되었다. 또한 ‘센서 이해 AI' 기술(DNA) 연구는 영상처리 분야 최고 국제 학술지인 ‘IEEE Transactions on Image Processing’에 게재가 되었다.
※ 논문명: Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking, DOI:10.48550/arXiv.2412.20750
※ 저자 정보: 정상윤 (KAIST, 공동 제1 저자), 유영준 (KAIST, 공동 제1 저자), 김세연 (KAIST, 제3 저자), 지영채 (KAIST, 제4 저자), 노용만(KAIST, 교신저자)
※ 논문명: MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models, DOI:10.48550/arXiv.2601.21181
※ 저자 정보: 정상윤 (KAIST, 제1 저자), 김세연 (KAIST, 제2 저자), 지영채 (KAIST, 제3 저자), 노용만(KAIST, 교신저자)
한편, 이번 연구는 정보통신기획평가원(IITP) 사람중심인공지능 핵심원천기술 개발사업과 국방과학연구소 인공지능 특화연구센터(CARAI) 과제 등의 지원을 받아 수행되었다.
24시간 말하는 AI비서 가능성 여는 '스피치SSM' 개발
최근 음성 언어 모델(Spoken Language Model, SLM)은 텍스트 없이 인간의 음성을 학습해 음성의 언어적, 비언어적 정보를 이해 및 생성하는 기술로 텍스트 기반 언어 모델의 한계를 넘어서는 차세대 기술로 각광받고 있다. 하지만 기존 모델은 장시간 콘텐츠 생성이 요구되는 팟캐스트, 오디오북, 음성비서 등에서 한계가 두드러졌는데, 우리 연구진이 이런 한계를 뛰어넘어, 시간 제약 없이 일관되고 자연스러운 음성 생성을 실현한 ‘스피치SSM’을 개발하는데 성공했다.
우리 대학 전기및전자공학부 노용만 교수 연구팀의 박세진 연구원(박사과정)이 장시간 음성 생성이 가능한 음성 언어 모델 ‘스피치SSM(SpeechSSM)’을 개발했다고 3일 밝혔다.
이번 연구는 국제 최고 권위 머신러닝 학회인 ICML(International Conference on Machine Learning) 2025에 전체 제출된 논문 중 약 1%만이 선정되는 구두 논문 발표에 확정돼 뛰어난 연구 역량을 입증할 뿐만 아니라 우리 대학의 인공지능 연구 능력이 세계 최고 수준임을 다시 한번 보여주는 계기가 될 전망이다.
음성 언어 모델(SLM)은 중간에 텍스트로 변환하지 않고 음성을 직접 처리함으로써, 인간 화자 고유의 음향적 특성을 활용할 수 있어 대규모 모델에서도 고품질의 음성을 빠르게 생성할 수 있다는 점이 큰 강점이다.
그러나 기존 모델은 음성을 아주 세밀하게 잘게 쪼개서 아주 자세한 정보까지 담는 경우, ‘음성 토큰 해상도’가 높아지고 사용하는 메모리 소비도 증가하는 문제로 인해 장시간 음성의 의미적, 화자적 일관성을 유지하기 어려웠다.
연구팀은 이러한 문제를 해결하기 위해 하이브리드 상태공간 모델(Hybrid State-Space Model)을 사용한 음성 언어 모델인‘스피치SSM’를 개발해 긴 음성 시퀀스를 효율적으로 처리하고 생성할 수 있게 설계했다.
이 모델은 최근 정보에 집중하는 ‘어텐션 레이어(attention layer)’와 전체 이야기 흐름(장기적인 맥락)을 오래 기억하는 ‘순환 레이어(recurrent layer)’를 교차 배치한 ‘하이브리드 구조’를 통해 긴 시간 동안 음성을 생성해도 흐름을 잃지 않고 이야기를 잘 이어간다. 또한, 메모리 사용량과 연산량이 입력 길이에 따라 급격히 증가하지 않아, 장시간의 음성을 안정적이고 효율적으로 학습하고 생성할 수 있다.
스피치SSM은 음성 데이터를 짧은 고정된 단위(윈도우)로 나눠 각 단위별로 독립적으로 처리하고, 전체 긴 음성을 만들 경우에는 다시 붙이는 방식을 활용해 쉽게 긴 음성을 만들 수 있어 무한한 길이의 음성 시퀀스(unbounded speech sequence)를 효과적으로 처리할 수 있게 했다.
또한 음성 생성 단계에서는 한 글자, 한 단어 차례대로 천천히 만들어내지 않고, 여러 부분을 한꺼번에 빠르게 만들어내는 ‘비자기회귀(Non-Autoregressive)’방식의 오디오 합성 모델(SoundStorm)을 사용해, 고품질의 음성을 빠르게 생성할 수 있게 했다.
기존은 10초 정도 짧은 음성 모델을 평가했지만, 연구팀은 16분까지 생성할 수 있도록 자체 구축한 새로운 벤치마크 데이터셋인 ‘LibriSpeech-Long'을 기반으로 음성을 생성하는 평가 태스크를 새롭게 만들었다.
기존 음성 모델 평가 지표인 말이 문법적으로 맞는지 정도만 알려주는 PPL(Perplexity)에 비해, 연구팀은 시간이 지나면서도 내용이 잘 이어지는지 보는 'SC-L(semantic coherence over time)', 자연스럽게 들리는 정도를 시간 따라 보는 'N-MOS-T(naturalness mean opinion score over time)' 등 새로운 평가 지표들을 제안해 보다 효과적이고 정밀하게 평가했다.
새로운 평가를 통해 스피치SSM 음성 언어 모델로 생성된 음성은 긴 시간 생성에도 불구하고 초기 프롬프트에서 언급된 특정 인물이 지속적으로 등장하며, 맥락적으로 일관된 새로운 인물과 사건들이 자연스럽게 전개되는 모습을 확인했다. 이는 기존 모델들이 장시간 생성 시 쉽게 주제를 잃고 반복되는 현상을 보였던 것과 크게 대조적이다.
박세진 박사과정생은 “기존 음성 언어 모델은 장시간 생성에 한계가 있어, 실제 인간이 사용하도록 장시간 음성 생성이 가능한 음성 언어 모델을 개발하는 것이 목표였다”며 “이번 연구 성과를 통해 긴 문맥에서도 일관된 내용을 유지하면서, 기존 방식보다 더 효율적이고 빠르게 실시간으로 응답할 수 있어, 다양한 음성 콘텐츠 제작과 음성비서 등 음성 AI 분야에 크게 기여할 것으로 기대한다”라고 밝혔다.
이 연구는 제1 저자인 우리 대학 박세진 박사과정 학생이 구글 딥마인드(Google DeepMind)와 협력해, ICML(국제 머신러닝 학회) 2025에서 7월 16일 구두 발표로 소개될 예정이다.
※ 논문제목: Long-Form Speech Generation with Spoken Language Models
※ DOI: 10.48550/arXiv.2412.18603
한편, 박세진 박사과정생은 비전, 음성, 언어를 통합하는 연구를 수행하며 CVPR(컴퓨터 비전 분야 최고 학회) 2024 하이라이트 논문 발표, 2024년 ACL(자연어 처리 분야 최고 학회)에서 우수논문상(Outstanding Paper Award) 수상 등을 통해 우수한 연구 역량을 입증한 바 있다.
[데모 페이지 링크]
https://google.github.io/tacotron/publications/speechssm/
멀티모달 대형언어모델이 GPT-4V를 뛰어넘다
멀티모달 대형 언어모델이란 텍스트뿐만 아니라 이미지 데이터 유형까지 처리할 수 있는 초대형 언어모델을 말한다. 해외 대형 기업의 풍부한 컴퓨팅 자원의 지원으로부터 인간의 뇌에 있는 신경망의 개수와 유사한 수준초대형모델들이 만들어지고 있으나 학계에서는 이런 개발이 쉽지 않았다. KAIST 연구진이 오픈AI의 GPT-4V와 구글의 제미나이-프로(Gemini-Pro)를 뛰어넘는 멀티모달 대형언어모델을 개발하여 화제다.
우리 대학 전기및전자공학부 노용만 교수 연구팀이 오픈AI(OpenAI)의 GPT-4V 등 기업에서 비공개하고 있는 상업 모델인 초대형 언어모델의 시각 성능을 뛰어넘는 공개형 멀티모달 대형 언어모델을 개발해 출시했다고 20일 밝혔다.
노용만 교수 연구팀은 단순히 모델의 크기를 키우거나 고품질의 시각적 지시 조정 데이터셋을 만들지 않고 멀티모달 대형언어모델의 시각 성능을 획기적으로 높인 콜라보(CoLLaVO), 모아이(MoAI) 2가지 기술을 연속적으로 개발했다고 밝혔다.
연구팀이 개발한 첫번째 기술인 ‘콜라보(CoLLaVO)’는 현존하는 공개형 멀티모달 대형언어모델이 비공개형 모델의 성능에 비해 현저하게 낮은 이유를 일차적으로 물체 수준에 대한 이미지 이해 능력이 현저하게 떨어진다는 것을 먼저 검증해 보였다.
해당 능력을 효율적으로 증가시켜 시각-언어 태스크에 대한 성능을 향상 하기 위해 연구팀은 이미지 내의 정보를 배경과 물체 단위로 분할하고 각 배경 및 물체에 대한 정보를 멀티모달 대형언어모델에 입력으로 직접 넣어주는 새로운 방법‘크레용 프롬프트(Crayon Prompt)’라는 시각적 프롬프트를 새롭게 제안했다.
또한 시각적 지시 조정 단계에서 크레용 프롬프트로 학습한 정보를 잃어버리지 않기 위해 연구팀은 물체 수준 이미지 이해 능력과 시각-언어 태스크 처리 능력을 서로 다른 파라미터로 학습해 서로 간의 정보를 잃지 않게 만드는 획기적인 학습 전략인 ‘듀얼 큐로라(Dual QLoRA)’를 제안했다. 이를 통해, 콜라보(CoLLaVO) 멀티모달 대형언어모델은 이미지 내에서 배경 및 물체를 구분하는 능력이 뛰어나 일차원적인 시각 구분 능력이 크게 향상됐다고 밝혔다.
두 번째 대형언어모델인 ‘모아이(MoAI)’는 인간이 사물을 판단할 때 물체의 존재, 상태, 물체 간의 상호작용, 배경에 대한 이해, 텍스트에 대한 이해 등으로부터 상황을 판단하는 인지과학적인 요소에 영감을 받아서 만들어졌다고 밝혔다.
이는 기존 멀티모달 대형언어모델이 텍스트에 의미적으로 정렬된 시각 인코더(vision encoder)만을 사용하기 때문에, 이미지 픽셀 수준에서의 상세하고 종합적인 실세계 장면 이해가 부족하다는 점을 지적하며 이런 컴퓨터 비전 모델들의 결과를 받으면 모두 인간이 이해할 수 있는 언어로 변환한 뒤에 멀티모달 대형언어모델에 입력으로 직접 사용했다.
노용만 교수는 “연구팀에서 개발한 공개형 멀티모달 대형언어모델이 허깅페이스 일간 화제의 논문(Huggingface Daily Papers)에 추천됐고, 각종 SNS를 통해 세계 연구자에게 알려지고 있으며, 모든 모델을 공개형 대형언어모델로 출시 했기 때문에 이 연구모델이 멀티모달 대형언어모델 발전에 기여할 것이다”이라고 언급했다.
연구팀이 개발한 멀티모달 대형언어모델인 콜라보(CoLLaVO)와 모아이(MoAI)는 KAIST 전기및전자공학부 이병관 박사과정이 제1 저자로 참여하고 박범찬 석박사통합과정, 김채원 박사과정이 공동 저자로 참여했다.
콜라보(CoLLaVO)는 자연어 처리(NLP) 분야 최고의 국제 학회인 ‘Findings of the Association for Computational Linguistics(ACL Findings) 2024’에 5월 16일 자로 학회에 승인받았고, 모아이(MoAI)는 컴퓨터 비전 최고의 국제 학회인 ‘European Conference on Computer Vision(ECCV) 2024’학회 승인 결과를 기다리고 있다고 밝혔다.
한편 이번 연구는 KAIST 미래국방 인공지능 특화연구센터 및 전기및전자공학부의 지원을 받아 수행됐다.
[1] CoLLaVO 데모 GIF 영상
https://github.com/ByungKwanLee/CoLLaVO
[2] MoAI 데모 GIF 영상
https://github.com/ByungKwanLee/MoAI
딥러닝 적대적 공격을 막는 방어 프레임 개발
우리 대학 전기및전자공학부 노용만 교수 연구팀이 물체를 검출하는 딥러닝 신경망에 대한 적대적 공격을 방어하는 알고리즘을 개발했다고 15일 밝혔다.
최근 몇 년간 인공지능 딥러닝 신경망 기술이 나날이 발전하고 실세계에 활용되면서, 딥러닝 신경망 기술은 자율주행 및 물체검출 등 다양한 분야에서 떠오르는 핵심기술로 주목받고 있다.
하지만 현재의 딥러닝 기반 검출 네트워크는, 특정한 적대적 패턴을 입력 이미지에 악의적으로 주입하여 잘못된 예측 결과를 초래하는 적대적 공격에 대해 심각하게 취약하다. 적대적 패턴이란 공격자가 검출이 되지 않기 위해 인위적으로 만든 패턴이다. 이 패턴이 포함된 물체는 검출이 되지 않게 하는 것으로 적대적 패턴 공격이라 한다.
이러한 취약성은 인공지능으로 대표되는 딥러닝 기반의 모델을 국방이나 의료 및 자율주행 등 국민의 생명과 재산을 직접 다루는 분야에 적용할 때 크게 문제가 된다. 구체적인 예로 국방·보안을 위한 감시 정찰 분야에서 적군이 적대적 패턴으로 위장하여 침입하면 검출을 못하는 경우가 발생하여 국방 및 보안에 매우 큰 위험을 초래할 수 있다.
기존의 많은 연구가 적대적 패턴 공격을 막기 위해 노력했으나 추가로 복잡한 모듈이 필요하거나 네트워크를 처음부터 다시 학습해야 했기 때문에, 기존 연구는 실시간으로 동작하는 물체검출 알고리즘에 현실적으로 적용하기가 쉽지 않았다.
노 교수 연구팀은 물리적인 환경에서 적대적 패턴 공격의 원리를 반대로 이용해 적대적 공격을 막아내는 방어 프레임을 고안했다. 이러한 방어 프레임은 부가적인 복잡한 모듈이나 네트워크의 재학습이 필요하지 않으므로 보다 실용적이고 강인한 물체검출 네트워크를 구축하는데 폭넓게 응용 및 적용될 수 있을 것으로 기대된다.
공동 제1 저자인 전기및전자공학부 유영준 박사과정 학생과 이홍주 박사과정 학생 등이 함께 수행한 이번 연구는 영상처리 분야 최고의 국제 학술지인 `IEEE Transactions on Image Processing'에 11월 1일 자로 온라인 게재됐다. (논문명 : Defending Person Detection Against Adversarial Patch Attack by using Universal Defensive Frame).
연구팀은 문제 해결을 위해 적대적 공격의 원리를 역으로 이용해, 학습된 네트워크에 접근하지 않으면서도 입력단에서 방어할 수 있는 방어 프레임 기술을 고안했다.
연구팀의 방어 기술은 적대적 공격과 정반대로 물체검출 시 딥러닝 모델이 옳은 예측 결과를 내리도록 방어 프레임을 만드는 것이다. 이러한 방어 프레임은 마치 창과 방패의 싸움처럼 적대적 패턴과 함께 경쟁적으로 학습되며, 해당 과정을 반복해 최종적으로 모든 적대적 패턴 공격에 대해 높은 방어성능을 지니도록 최적화된다.
연구팀은 입력 이미지 외부에 덧붙이는 방어 프레임을 변화시킴으로써 손쉽게 방어성능을 조절할 수 있음을 확인했고, 개발된 방어 프레임은 인리아(INRIA) 검출 벤치마크 데이터셋에서 기존 방어 알고리즘 대비 평균 31.6% 정확도가 향상하는 성과를 거뒀다.
연구팀이 개발한 방어 프레임은 실시간 물체 탐지 시, 모델의 재학습 없이 적대적 패턴 공격을 방어할 수 있으므로 예측 시간 및 비용 절감을 크게 이룰 수 있을 것으로 기대된다.
연구팀은 나아가 이번 연구에서 개발된 방어 프레임을 물리적으로 직접 구현시켜서, 물리적 환경에 자연스레 놓여있는 적대적 패턴 공격과 마찬가지로 좀 더 접근성 있는 방어 방법으로도 활발히 응용될 수 있음을 제시하였다.
노용만 교수는 "국방 및 보안 분야에서 인공지능이 활용되기 위해서 아직 인공지능의 완전성을 높이는 많은 연구가 필요한데, 이번에 개발된 방어 기술은 이 분야들에서 인공지능 모델을 적용 시 실용적인 적대적 방어를 제시함에 의의가 있을 것ˮ이라며 "이 기술은 국방 감시정찰, 보안, 자율주행 분야에도 적용될 수 있을 것이다ˮ라고 말했다.
한편 이번 연구는 방위사업청과 국방과학연구소의 지원으로 한국과학기술원 미래국방 인공지능 특화연구센터에서 수행됐다.
김성태 박사과정, 로버트와그너 최우수 학생 논문상 수상
〈 김 성 태 박사과정 〉
우리 대학 전기및전자공학부 김성태 박사과정(지도교수: 노용만)이 지난달 10일~15일 미국 휴스턴에서 열린 국제광자공학회 (SPIE: The International Society for Optics and Photonics)의 의료영상 학술대회 (Medical Imaging Conference)에서 로버트와그너 최우수 학생 논문상 (Robert F. Wagner All-Conference Best Student Paper Award Finalist)에 선정됐다.
국제광학회 의료영상 학술대회는 의료영상 분야 세계 최대 규모 학술대회 중 하나로 올해 900 여편의 논문이 발표됐다. 그 중 로버트와그너 최우수 학생 논문 상은 의료영상 전분야 9개의 각 분과별로 1편씩 선정됐으며 김 박사과정의 논문은 컴퓨터 지원 진단 (Computer-Aided Diagnosis) 분과에서 최우수 학생 논문상을 수상했다.
수상 논문은 '해석 가능한 딥러닝 연구'의 결과로 딥러닝 기반 컴퓨터 지원 진단에서 의사들의 용어로 유방암 진단의 근거를 제공하는 기술에 대한 논문이다. (논문명: ICADx: Interpretable computer aided diagnosis of breast masses)
김성태 박사과정은 “이번 학술대회에서 컴퓨터 지원 진단 분과 최우수 학생 논문상에 입상하게 돼 영광이며 지도교수님의 훌륭한 지도와 연구를 도와준 동료들이 있었기에 가능했다고 말하며 감사하다” 고 말했다.