
< KAIST 김재철AI대학원 최재식 교수 >
최근 텍스트 기반 이미지 생성 모델은 자연어로 제공된 설명만으로도 고해상도·고품질 이미지를 자동 생성할 수 있다. 하지만, 대표적인 예인 스테이블 디퓨전(Stable Diffusion) 모델에서 ‘창의적인’이라는 텍스트를 입력했을 경우, 창의적인 이미지 생성은 아직은 제한적인 수준이다. KAIST 연구진이 스테이블 디퓨전(Stable Diffusion) 등 텍스트 기반 이미지 생성 모델에 별도 학습 없이 창의성을 강화할 수 있는 기술을 개발해, 예컨대 뻔하지 않은 창의적인 의자 디자인도 인공지능이 스스로 그려낼 수 있게 됐다.
우리 대학 김재철AI대학원 최재식 교수 연구팀이 네이버(NAVER) AI Lab과 공동 연구를 통해, 추가적 학습 없이 인공지능(AI) 생성 모델의 창의적 생성을 강화하는 기술을 개발했다.

< NAVER AI Lab 이가영 연구원, KAIST 김재철AI대학원 권다희 박사과정, KAIST 김재철AI대학원 한지연 박사과정, NAVER AI Lab 김준호 연구원 >
최 교수 연구팀은 텍스트 기반 이미지 생성 모델의 내부 특징 맵을 증폭해 창의적 생성을 강화하는 기술을 개발했다. 또한, 모델 내부의 얕은 블록들이 창의적 생성에 중요한 역할을 한다는 것을 발견하고, 특징 맵을 주파수 영역으로 변환 후, 높은 주파수 영역에 해당하는 부분의 값을 증폭하면 노이즈나 작게 조각난 색깔 패턴의 형태를 유발하는 것을 확인했다. 이에 따라, 연구팀은 얕은 블록의 낮은 주파수 영역을 증폭함으로써 효과적으로 창의적 생성을 강화할 수 있음을 보였다.
연구팀은 창의성을 정의하는 두 가지 핵심 요소인 독창성과 유용성을 모두 고려해, 생성 모델 내부의 각 블록 별로 최적의 증폭 값을 자동으로 선택하는 알고리즘을 제시했다.
개발된 알고리즘을 통해 사전 학습된 스테이블 디퓨전 모델의 내부 특징 맵을 적절히 증폭해 추가적인 분류 데이터나 학습 없이 창의적 생성을 강화할 수 있었다.

< 그림 1. 개발팀에서 연구한 방법론 개요. 사전 학습된 생성 모델의 내부 특징맵을 고속푸리에변환을 통해 주파수 영역으로 변환 후, 낮은 주파수 영역의 특징맵을 증폭, 다시 고속푸리에역변환을 통해 특징공간으로 재변환하여 이미지를 생성한다. >
연구팀은 개발된 알고리즘을 사용하면 기존 모델 대비 더욱 참신하면서도 유용성이 크게 저하되지 않은 이미지를 생성할 수 있음을 다양한 측정치를 활용해 정량적으로 입증했다.
특히, 스테이블 디퓨전 XL(SDXL) 모델의 이미지 생성 속도를 대폭 향상하기 위해 개발된 SDXL-Turbo 모델에서 발생하는 모드 붕괴 문제를 완화함으로써 이미지 다양성이 증가한 것을 확인했다. 나아가, 사용자 연구를 통해 사람이 직접 평가했을 때도 기존 방법에 비해 유용성 대비 참신성이 크게 향상됨을 입증했다.
공동 제1 저자인 KAIST 한지연, 권다희 박사과정은 "생성 모델을 새로 학습하거나 미세조정 학습하지 않고 생성 모델의 창의적인 생성을 강화하는 최초의 방법론ˮ이라며 "학습된 인공지능 생성 모델 내부에 잠재된 창의성을 특징 맵 조작을 통해 강화할 수 있음을 보였다ˮ 라고 말했다.
이어 “이번 연구는 기존 학습된 모델에서도 텍스트만으로 창의적 이미지를 손쉽게 생성할 수 있게 됐으며, 이를 통해 창의적인 상품 디자인 등 다양한 분야에서 새로운 영감을 제공하고, 인공지능 모델이 창의적 생태계에서 실질적으로 유용하게 활용될 수 있도록 기여할 것으로 기대된다”라고 밝혔다.

< 그림 2. 개발팀에서 연구한 방법론의 적용 사례. 다양한 Stable Diffusion 모델에서 기존 생성 대비 생성 대상의 의미를 유지하면서도 참신한 이미지를 생성함. >
KAIST 김재철AI대학원 한지연 박사과정과 권다희 박사과정이 공동 제1 저자로 참여한 이번 연구는 국제 학술지 `국제 컴퓨터 비전 및 패턴인식 학술대회 (IEEE Conference on Computer Vision and Pattern Recognition, CVPR)’에서 6월 15일 발표됐다.
※논문명 : Enhancing Creative Generation on Stable Diffusion-based Models
※DOI: https://doi.org/10.48550/arXiv.2503.23538
한편 이번 연구는 KAIST-네이버 초창의적 AI 연구센터, 과학기술정보통신부의 재원으로 정보통신기획평가원의 지원을 받은 혁신성장동력프로젝트 설명가능인공지능, AI 연구거점 프로젝트, 점차 강화되고 있는 윤리 정책에 발맞춰 유연하게 진화하는 인공지능 기술 개발 연구 및 KAIST 인공지능 대학원 프로그램과제의 지원을 받았고 방위사업청과 국방과학연구소의 지원으로 KAIST 미래 국방 인공지능 특화연구센터에서 수행됐다.
AI 반도체도 이제‘눈치'를 본다. 기존 AI 반도체는 입력 신호에 반응하는 속도와 정보를 기억하는 시간이 한 번 정해지면 바꿀 수 없는‘고정된 반응 특성'을 가졌지만, 이제는 데이터의 변화 속도에 맞춰 스스로 반응하는 시대가 열렸다. 우리 대학 연구진은 이 기술로 시간에 따라 변하는 데이터의 예측 오류를 기존보다 최대 40배 줄였다. 자율주행차와 로봇, 웨어러블 기기의 실시간 AI 성능을 높일 핵심 원천기술로 기대된다. 우리 대학은 전기및전자공학부·반도체공학대학원 최신현 석좌교수 연구팀이 입력되는 데이터의 변화 속도에 따라 반응 특성을 자유롭게 바꿀 수 있는 새로운 AI 반도체 소자‘프로그래머블 동적 멤트랜지스터(Programmable Dynamic Memtransistor, PDM)'와 이를 집적한 어레이를 개발했다고 7일 밝혔다. 멤트랜지스터(Memtransistor)는 정보를 저장하는 메모리(Memory)와 계산을 수행하
2026-08-07폭발적으로 늘어나는 AI 데이터센터 시대를 뒷받침할‘거대한 배터리'의 상용화가 한층 가까워졌다. 우리 대학 연구진이 대용량 배터리의 핵심 소재 생산 시간을 67% 줄이는 공정 기술을 개발해 상용화의 가장 큰 생산 병목을 해결했다. 우리 대학은 생명화학공학과 김희탁 교수 연구팀이 대용량 에너지저장장치(ESS)의 유력 후보인 바나듐 레독스 흐름전지(VRFB)의 핵심 전해질을 빠르고 안정적으로 생산하는 공정을 개발했다고 5일 밝혔다. 최근 24시간 끊임없이 가동되는 AI 데이터센터가 급증하면서 태양광과 풍력 등 재생에너지로 생산한 전기를 대량으로 저장했다가 필요할 때 안정적으로 공급하는 대용량 ESS의 중요성이 커지고 있다. 특히 바나듐 레독스 흐름전지는 화재 위험이 거의 없고, 전해질을 담는 탱크만 크게 만들면 저장 용량도 쉽게 늘릴 수 있어 AI 데이터센터와 재생에너지용 초대형 배터리로 주목받고 있다. 그러나 배터리의‘연료' 역할을 하는 바나듐 전해질
2026-08-05AI가 글을 쓰고 그림을 그리던 화면 밖으로 나와 현실 세계를 보고 움직이는 피지컬 AI(Physical AI) 시대가 열리고 있다. 우리 대학이 학생들의 상상을 실제 움직이는 로봇으로 구현하는 100시간의 도전을 통해 피지컬 AI 인재 양성에 나선다. 우리 대학은 우리 대학과 서울대학교 학생들이 만든 연합단체 로보틱어스(RoboticUS)가 8월 3일부터 8일까지 KAIST에서 ‘제1회 로봇 해커톤’을 개최한다고 4일 밝혔다. 배충식 KAIST 총장은 “피지컬 AI 시대에는 AI를 잘 만드는 것을 넘어 AI를 기반으로 실제 세상을 움직이는 로봇과 시스템을 설계하고 구현할 수 있는 융합형 인재가 필요하다”며 “학생들이 스스로 기획하고 운영한 이번 해커톤은 KAIST의 도전과 협업 문화를 보여주는 좋은 사례이며, 미래 기술을 현실로 구현하는 새로운 교육 모델이 될 것으로 기대한다”고 말했다. 이번 해커톤은 이러한
2026-08-04택배 배송과 공장 생산계획, 병원 근무표까지. 앞으로는 인공지능(AI)이 현실의 모든 조건을 고려해‘실제로 실행 가능한 계획'을 스스로 만드는 시대가 열린다. 우리 대학 연구진이 외부 전문 최적화 프로그램의 도움 없이 AI가 스스로 실행 가능한 계획을 만드는 기술을 개발했다. 우리 대학은 전산학부 김민수 교수 연구팀이 외부의 전문 최적화 프로그램(솔버, Solver·복잡한 최적화 문제의 정답을 자동으로 계산하는 프로그램) 없이도 AI가 스스로 실행 가능한 계획을 만들도록 학습하는 강화학습(Reinforcement Learning·시행착오를 반복하며 더 나은 선택을 배우는 AI 학습 방식) 기술‘RL-SPH(Reinforcement Learning-based Start Primal Heuristic)'를 개발했다고 3일 밝혔다. 이번 기술은 AI가 현실의 여러 제약조건을 스스로 만족하는 계획을 만들어낼 수 있도록 한 것이 핵심이다.
2026-08-03AI가 ‘안 들리는데 들린다’, ‘없는데 있다’고 우기는 시대가 끝난다. 우리 대학 연구진이 AI가 여러 감각 정보를 스스로 구분하고 존재하지 않는 정보를 만들어내는 ‘환각’을 줄이는 핵심 기술을 개발했다. 자율주행차와 로봇, 의료 AI 등 실제 산업 현장에서 더욱 신뢰할 수 있는 멀티모달 AI 구현의 기반이 될 것으로 기대된다. 우리 대학은 전기및전자공학부 노용만 교수 연구팀이 멀티모달 대형 언어모델(MLLM, 텍스트와 이미지·소리 등 여러 정보를 함께 이해하는 AI)의 감각 혼선을 줄이는 두 가지 핵심 기술을 개발했다고 31일 밝혔다. 이번 기술은 카메라와 다양한 센서의 특성을 정확히 이해하도록 하는 기술과 시각·청각 정보가 뒤섞이면서 발생하는 환각을 줄이는 기술로, 별도의 대규모 재학습 없이도 AI의 신뢰성을 크게 높였다. 연구팀이 개발한 첫 번째 기술은 AI가 열화상(Thermal
2026-08-03