KAIST, AI '감각 혼선' 줄이기 위한 기술 개발

IT/과학

이데일리,

2026년 7월 31일, 오전 08:52

[이데일리 강민구 기자] 한국과학기술원(KAIST) 연구진이 AI가 여러 감각 정보를 스스로 구분하고 존재하지 않는 정보를 만들어내는 ‘환각’을 줄이는 기술을 개발했다.

KAIST는 노용만 전기전자공학부 교수 연구팀이 멀티모달 대형 언어모델(MLLM)의 감각 혼선을 줄이는 핵심 기술을 개발했다고 31일 밝혔다.

KAIST 연구진.(왼쪽부터)정상윤 박사과정, 노용만 교수, 유영준 박사.(사진=KAIST)
KAIST 연구진.(왼쪽부터)정상윤 박사과정, 노용만 교수, 유영준 박사.(사진=KAIST)
연구팀이 개발한 첫 번째 기술은 AI가 열화상(물체가 내는 열을 영상으로 보여주는 센서), 깊이 영상(물체까지의 거리를 측정하는 센서), 엑스레이 등 다양한 센서가 담은 물리적 의미를 정확하게 이해하도록 돕는 ‘센서 이해 AI’ 기술 최적화 기법이다.

사람은 열화상 화면에서 밝게 보이는 부분이 ‘뜨거운 곳’이라는 것을 알지만, 기존 AI는 이를 일반 사진처럼 해석해 단순한 빛으로 착각한다. 이에 연구팀은 AI가 열과 거리 등 센서가 측정하는 물리 정보를 이해하기 위한 학습 기술을 개발했다. AI가 자주 틀리는 사례를 반복 학습시켜 어둠이나 연기 속에서도 사물을 더 정확하게 인식하게 했다.

두 번째 기술은 시각과 청각 정보가 서로 영향을 주면서 발생하는 환각을 줄이는 ‘감각 혼선 방지’ 기술이다.

CCTV 영상에 자동차가 지나가는 장면이 담겨 있지만 실제 소리가 녹음되지 않았을 때 기존 멀티모달 AI는 자동차가 보인다는 이유만으로 ‘엔진 소리가 들린다’고 답하는 경우가 있었다. 연구팀은 AI가 먼저 ‘이번 질문은 영상을 보고 판단해야 하는지, 소리를 듣고 판단해야 하는지’를 스스로 구분한 뒤, 더 중요한 감각 정보에 집중하도록 만들었다.

AI로 생성한 연구 이미지.(자료=KAIST)
AI로 생성한 연구 이미지.(자료=KAIST)
연구진이 개발한 기술은 밤이나 안개 속에서도 보행자와 차량을 정확히 인식해야 하는 자율주행차, 연기로 앞이 보이지 않는 화재 현장에서 생존자를 찾는 구조 로봇, 열화상 카메라를 이용하는 드론에 활용할 수 있다. 공항 보안검색에서 엑스레이 영상을 분석하거나, 병원에서 CT·MRI·엑스레이 등 여러 의료영상을 함께 분석하는 AI에 적용해 정확성과 신뢰성을 높일 수도 있다.

노용만 교수는 “멀티모달 AI가 실제 환경에서 사용되려면 다양한 센서의 특성을 정확히 이해하고 여러 감각 정보를 혼동하지 않는 것이 중요하다”며 “대규모 재학습 없이도 AI의 감각 편향과 환각을 줄여 실제 생활과 산업 현장에서 믿고 사용할 수 있는 멀티모달 AI의 기반을 마련했다”고 말했다.

‘감각 혼선 방지’ 기술 연구는 AI 컴퓨터 비전 분야 국제학회 ‘국제 컴퓨터 비전 및 패턴인식 학술대회’에 지난 달 발표됐다. ‘센서 이해 AI’ 기술 연구는 영상처리 분야 국제 학술지인 ‘IEEE Transactions on Image Processing’에 게재됐다.

추천 뉴스