-
- [연구] dxlab(지도교수 : 박은일), EMNLP 2026 2편, ECCV 2026 1편 게재 승인 NEW
- Data eXperience Lab (dxlab, 지도교수: 박은일)의 논문이 자연어 처리 분야 top-tier 국제학술대회인 EMNLP 2026에 2편, 컴퓨터 비전 분야 top-tier 국제학술대회인 ECCV 2026에 1편 게재 승인되었습니다! ECCV 2026 1. 제목: Finding Highlight Images In Your Albums: From Benchmark To MLLM 저자: 박은일(인공지능융합학과) 외 10명 박은일(dxlab 지도교수) 키워드: Album Highlight Recommendation, Visual Analysis, Cognition-based Image Attribute, Multimodal Large Language Model (MLLM), Dataset Benchmark 주요 내용: 개인 앨범 하이라이트 추천은 사용자의 추억 감상 및 소셜 미디어 공유에 가장 적합하고 가치 있는 사진을 자동으로 선별하는 과업입니다. 그러나 하이라이트 선별에 내재된 높은 주관성과 모호성으로 인해 신뢰할 수 있는 데이터셋 축적이 어려웠습니다. 이에 본 연구는 기존 공공 데이터셋을 5명의 작업자가 재레이블링하여 세분화된 점수로 통합한 910개 앨범(87K 이미지)과, 100명의 자원봉사자가 본인 앨범을 직접 레이블링한 고유한 개인화 데이터셋 C-AHR-100(10K 이미지)을 구축하여 데이터 부재 문제를 해결하고자 하였습니다. 뿐만 아니라, 해당 과업에 특화된 멀티모달 대형 언어 모델인 Highlight4U를 제안하고, 단일 이미지 단위의 Local Scoring와 상위 선별 이미지를 Global Reference를 활용하는 2단계 구조를 통해, 앨범 내 이벤트 맥락과 의미론적 관계를 반영하여 추천 정확도를 향상시킵니다. 핵심 기여 ■ 하이라이트 추천 연구를 위한 대규모 벤치마크 데이터셋 구축 (3개 데이터셋, 1,010개 앨범, 97K 이미지) 공공 앨범 데이터(PEC, CUFED)에 대해 5인 재레이블링을 거쳐 개인 편향을 완화한 세분화 점수(0~5점)를 부여하고, 실제 앨범 소유자가 직접 주관적 선호도를 반영해 레이블링한 C-AHR-100 데이터셋을 구축하여 데이터 공백을 해결 ■ MLLM 기반 특화 모델 Highlight4U 및 Local-Global 2단계 프레임워크 제안 점수 토큰의 확률 분포를 정교한 점수로 매핑하는 HDA(Highlight Distribution Aggregation) 모듈을 설계하고, 초기 상위 추천 결과를 캡션과 함께 전역 참조(Global Reference)로 제공함으로써 앨범 전체의 맥락과 이벤트 정보를 반영하는 재추천 메커니즘 구현 ■ 대중적 하이라이트 인지도 및 개인화 선호도 전이 가능성 검증 기존 비전 백본 및 SOTA MLLM 대비 우수한 하이라이트 추천 성능을 입증하였으며, 대중적 공감대 기반으로 학습된 모델이 실제 개별 소유자의 주관적 선호도 환경으로도 효과적으로 전이·일반화됨을 실증 성능 향상 요약 EMNLP 2026 (Main)1. 제목: ReflectRec: Cycle-Consistency Preference Verification for LLM-based Recommendation 저자: 김대규(인공지능융합학과 박사과정; 왼쪽 첫번째), 조희정(인공지능융합학과 박사과정;왼쪽 두번째), 홍성무(인공지능융합학과 박사과정), 박은일(인공지능융합학과) 키워드: LLM-based Recommendation, Preference Verification, Cycle-Consistency, Collaborative Signal, Natural Language Preference Elicitation, Generative Recommendation 주요 내용: 대형 언어 모델(LLM) 기반 추천 시스템은 사용자의 과거 소비 이력을 자연어 형태의 선호도 요약(Preference Note)으로 변환하여 추천 프롬프트에 활용합니다. 그러나 중간 단계에서 생성된 선호도가 실제 사용자 취향을 정확히 반영하는지 검증하는 체계가 부족하여 추상화 오류 및 환각(Hallucination)이 추천 정확도를 저해하고, 다른 유저들의 최근 소비 패턴인 협업 신호(Collaborative Signal)를 직접 활용하지 못하는 한계가 존재했습니다. 본 논문은 이러한 한계를 극복하기 위해 순환 일치성 기반 선호도 검증 및 협업 정보 결합 프레임워크인 ReflectRec을 제안합니다. ReflectRec은 5가지 의미적 축(장르, 분위기, 주제, 시대/스타일, 서사 방식)으로 선호도를 추출한 뒤, 선호도 글만으로 과거 시청 이력을 역복원하는 순환 일치성 검증기(Cycle-Consistency Verifier)를 도입하여 품질을 정량 평가(ValScore)합니다. 검증 점수가 낮은 저품질 선호도는 조건부로 재생성·보정하며, 사용자 이력 유사도 기반으로 타 유저의 다음 소비 아이템을 추출하는 전방 탐색 검색(Forward-Look Retrieval)을 연동함으로써 고품질 선호도와 협업 신호를 동시에 최종 LLM 랭커에 제공하여 추천 정확도를 대폭 향상시킵니다. 핵심 기여 ■ 순환 일치성(Cycle-Consistency) 기반 LLM 선호도 검증 메커니즘 제안 LLM이 생성한 자연어 선호도 요약문만으로 과거 사용자 소비 이력을 역으로 복원해내는 재현율 점수(ValScore)를 측정하고, 이 점수를 기준(Gate) 삼아 저품질 선호도를 선택적으로 재생성·보정하는 신뢰성 검증 체계 구현 ■ 타 유저의 미래 행동을 활용하는 전방 탐색 검색(Forward-Look Retrieval) 결합 과거 이력 임베딩 유사도가 높은 유사 사용자 그룹을 탐색한 후, 그들이 실제로 그 다음에 소비한 아이템 정보를 협업 힌트(Collaborative Hint)로 제공하여 단일 유저 중심 LLM 추천의 협업 필터링 한계 극복 ■ 다양한 벤치마크 및 백본 LLM 환경에서의 SOTA 성능 및 일반화 가능성 검증 MovieLens-100K(Hit@10 기준 기존 대비 +16.25%p) 및 MovieLens-1M에서 탁월한 성능 향상을 입증하였으며, 다양한 LLM 백본(Qwen, Llama 등) 및 타 도메인(Amazon Electronics)에서도 일관된 성능 개선 효과 실증 ReflectRec 논문 프레임워크 EMNLP 2026 (Finding) 1. 제목: K-Humor: Dynamic Multi-Agent LLM Framework for Generation of Culturally Grounded Korean Jokes 저자: 왼쪽부터 박민수(인공지능융합학과 박사과정), 전희정(인공지능융합학과 석사과정), 김동재(인공지능융합학과 박사과정), 오민우(메타바이오헬스학과 석사과정), 박은일(인공지능융합학과) 키워드: Korean Joke Generation, Culturally Grounded Humor, Dynamic Multi-Agent LLM, Contextual Bandit (UCB), Human-Data-Grounded Retrieval (HDG), Writers' Room Simulation 주요 내용 한국어 유머 생성은 언어의 복잡성(존댓말, 어미 변화)과 깊은 문화적 맥락, 그리고 서구권 중심 LLM의 문화적 편향으로 인해 정교한 유머를 구현하는 데 어려움이 있습니다. 또한 기존 단일 프롬프트(Single-pass) 기반 LLM은 코미디 작가들의 다단계 협업 및 피드백 기반 정제 과정을 반영하지 못하는 한계가 존재합니다. 본 논문은 실제 코미디 작가실(Writers' room)의 협업 프로세스를 모사한 동적 다중 에이전트 LLM 프레임워크 K-Humor를 제안하여 이 문제를 해결합니다. K-Humor는 문화적 맥락, 말장난, 청중 피드백, 에디터 검토 등을 담당하는 역할별 에이전트를 배치하고, UCB 알고리즘 기반 컨트롤러를 통해 도입부 수정 및 펀치라인 완성을 동적으로 제어합니다. 나아가 한국어 문장 임베딩(KoSimCSE) 기반의 인간 데이터 Retrieval(HDG) 메커니즘을 통합하여 최불암 시리즈 등 실제 인간 유머 데이터셋을 퓨샷(Few-shot) 예시로 활용함으로써 유머의 타격감과 문화적 공감대를 대폭 향상시킵니다. 핵심 기여 ■ 실제 협업 네트워크를 모사한 동적 다중 에이전트(K-Humor) 프레임워크 제안 문화, 말장난, 청중, 에디터 등 역할별 에이전트를 구축하고, UCB(Upper Confidence Bound) 컨트롤러를 통해 반전, 일관성, 중복성 신호를 감지하여 '설명 추가', '설명 수정', '펀치라인 작성'을 동적으로 판단·실행하는 3단계 정제 파이프라인 구현 ■ 인간 데이터 기반 Retrieval(HDG) 메커니즘 및 한국 문화 맥락 통합 한국어 언어유희 및 문화적 트렌드를 반영하는 특화 에이전트와 더불어, KoSimCSE를 활용해 유사한 인간 작성 유머 데이터(180건)를 동적으로 검색·참조하여 한국 특유의 정서와 유머 스타일을 정확히 이끌어내는 메커니즘 구축 ■ 다각도 평가(Human & LLM Evaluation)를 통한 정량적 우수성 입증 단일 프롬프트 베이스라인 대비 인간 평가 64.5%, LLM 평가 70.8%의 높 승률을 기록하며 뛰어난 유머 생성 성능을 입증하였으며, 소거 연구(Ablation Study)를 통해 동적 제어기 및 HDG 등 각 구성 요소의 실질적 유효성을 검증. 제안된 K-humor 프레임워크 요약 해당 연구들은 과학기술정보통신부와 정보통신기획평가원의 대학ICT연구센터와 AI최고급신진연구자지원사업, 학석사연계지원사업으로 수행되었습니다.
-
- 작성일 2026-09-08
- 조회수 303
-
- [일반] DSSAL Lab(지도교수: 김장현) EMNLP 2026 main conference 논문 1편 게재 승인 NEW
- 제목: No Matter Who You Are: Addressivity and Sycophancy in Large Language Models 저자: 선승종*, 전현민*, 윤민식, 이은구, 강충원, 우영석, 김장현 (*공동 제1저자) 본 연구는 사용자의 주장과 선호에 과도하게 맞추는 LLM의 아첨(Sycophancy)이 post-training 이후 왜 강화되는지 분석했습니다. Post-training이 모델의 출력을 특정 수신자를 향한 발화로 변화시킨다는 점에 주목해, 수신자 지향성(Addressivity)이 아첨 행동을 강화한다는 가설을 세웠습니다. Base 모델과 instruction-tuned 모델에서 Sparse Autoencoder(SAE)를 활용해 관련 내부 feature를 추출하고 Steering을 적용했습니다. 그 결과 instruction-tuned 모델에서 해당 feature를 강화하거나 억제했을 때 아첨 행동이 일관된 방향으로 변했습니다. 이는 post-training 과정에서 강화된 수신자 지향적 내부 표현이 아첨 행동의 증가와 연결되어 있음을 보여줍니다. 왼쪽부터 선승종 학생, 전현민 학생, 김장현 교수
-
- 작성일 2026-09-07
- 조회수 279
-
- [연구] 신뢰가능한인공지능연구단(연구책임자: 한진영) ‘Bias-A-Thon’ 연구 성과, EMNLP 2026 Findings 채택
- 신뢰가능한인공지능연구단(Pioneer Research Group for Socially Responsible AI, 연구책임자 한진영 교수)이 지난해 개최한 학생 참여형 연구 프로그램 ‘Bias-A-Thon’의 성과를 발전시킨 연구가 자연어처리 및 인공지능 분야의 세계 최고 수준 국제학술대회인 「2026 Conference on Empirical Methods in Natural Language Processing(EMNLP 2026)」 Findings에 채택됐다. 채택 논문의 제목은 「SCENE: A Scenario Completion Benchmark for Measuring Social Bias in Large Language Models」로, 대규모 언어모델(LLM)이 다양한 사회적 상황과 맥락에서 나타내는 사회적 편향(Social Bias)을 체계적으로 측정하고 평가하기 위한 새로운 벤치마크를 제안했다. EMNLP(Empirical Methods in Natural Language Processing)는 자연어처리(NLP)와 인공지능(AI) 분야에서 세계적으로 권위를 인정받는 최우수권 국제학술대회 중 하나다. 이번 논문 채택은 신뢰가능한인공지능연구단이 추진해 온 책임 있는 인공지능 연구와 국제 공동연구의 성과가 세계적 연구 커뮤니티에서 학술적으로 인정받았다는 점에서 의미가 크다. 이번 연구의 출발점은 신뢰가능한인공지능연구단이 지난해 개최한 ‘Bias-A-Thon’이다. Bias-A-Thon은 기존 해커톤의 형식을 인공지능의 사회적 편향 문제에 접목한 학생 참여형 연구 프로그램으로, 참가 학생들이 대규모 언어모델에서 나타날 수 있는 다양한 사회적 편향을 직접 탐색하고 이를 실제 연구에 활용할 수 있는 데이터로 구축하도록 기획됐다. 본교와 The Pennsylvania State University(Penn State) 학생들은 Bias-A-Thon을 통해 다양한 사회적 상황과 맥락에서 발생할 수 있는 편향 사례를 발굴했다. 이후 연구진은 학생들이 구축한 데이터를 체계화하고 분석해 대규모 언어모델의 사회적 편향을 측정할 수 있는 벤치마크 ‘SCENE’으로 발전시켰으며, 이러한 후속 연구가 이번 EMNLP 2026 논문 채택으로 이어졌다. SCENE은 특정 단어나 문장에 포함된 편향을 단순히 탐지하는 기존 방식에서 한 걸음 더 나아가, 대규모 언어모델이 다양한 사회적 상황과 맥락을 직접 완성하는 과정에서 어떠한 편향이 나타나는지를 평가하도록 설계됐다. 이를 통해 실제 생성형 AI 사용 환경에서 드러날 수 있는 보다 복합적이고 맥락적인 사회적 편향을 체계적으로 분석하는 것을 목표로 한다. 이번 연구에는 신뢰가능한인공지능연구단 연구책임자인 한진영 교수를 비롯해 최윤석 교수와 홍성은 교수, The Pennsylvania State University 교수이자 우리대학 석학교수인 S. Shyam Sundar 교수가 참여했다. 또한 본교 강미경, 정애천, 김민석 학생과 The Pennsylvania State University의 Eunchae Jang 학생이 연구에 함께 참여해 한·미 공동연구 성과를 만들어냈다. 특히 이번 성과는 연구단이 기획한 학생 참여형 연구 프로그램이 일회성 행사에 머무르지 않고, 학생들의 데이터 구축과 한·미 연구진의 후속 공동연구를 거쳐 세계 최고 수준 국제학술대회의 논문으로 발전했다는 점에서 의미가 크다. 과학기술정보통신부와 정보통신기획평가원(IITP)의 해외석학유치지원사업을 기반으로 조성한 국내외 교수진 및 학생 간 연구·교류 환경이 구체적인 국제 학술 성과로 이어진 대표적인 사례라는 점에서도 주목된다. 한진영 신뢰가능한인공지능연구단 연구책임자는 “Bias-A-Thon은 학생들이 인공지능의 사회적 편향이라는 중요한 문제를 직접 탐색하고, 실제 연구 데이터 구축 과정에 참여할 수 있도록 기획한 프로그램”이라며 “성균관대학교와 Penn State 학생 및 연구진이 함께 만들어낸 결과가 후속 공동연구를 거쳐 자연어처리 및 인공지능 분야의 세계 최고 수준 국제학술대회인 EMNLP에 논문으로 채택됐다는 점에서 더욱 뜻깊다”고 밝혔다. 이어 “학생들이 국제 연구진과 함께 연구 문제를 발굴하고 데이터를 구축하는 데서 그치지 않고, 그 결과를 세계적인 학술 무대에서 연구 성과로 발전시키는 경험까지 할 수 있었다는 점 역시 중요한 의미가 있다”며 “앞으로도 해외석학유치지원사업을 기반으로 해외 연구진과의 실질적인 공동연구와 학생 교류를 확대하고, 신뢰할 수 있고 사회적으로 책임 있는 인공지능 분야에서 국제적으로 인정받는 연구 성과를 지속적으로 만들어 나가겠다”고 말했다. 신뢰가능한인공지능연구단은 과학기술정보통신부와 정보통신기획평가원(IITP)의 지원을 받는 해외석학유치지원사업의 일환으로 운영되고 있으며, 해외 우수 연구자와 국내 연구진 간 지속적인 공동연구와 인재 교류를 통해 사회적으로 책임 있고 신뢰할 수 있는 인공지능 기술 개발을 추진하고 있다.
-
- 작성일 2026-09-03
- 조회수 47
-
- [일반] 신뢰가능한인공지능연구단(연구소장: 한진영), KDD 2026서 ‘책임 있는 멀티모달 AI’ 국제 워크숍 성료
- 본교 신뢰가능한인공지능연구단(연구책임자 한진영 교수)이 지난 8월 9일 제주국제컨벤션센터(ICC 제주)에서 국제 워크숍 「RespMultimodal 2026: The First International Workshop on Responsible Multimodal Foundation Models for Knowledge Discovery」를 성황리에 개최했다. 이번 워크숍은 데이터마이닝 분야의 세계적 권위 학회인 ACM SIGKDD 2026과 연계해 열렸으며, 성균관대 신뢰가능한인공지능연구단을 중심으로 국내외 연구진이 공동으로 조직했다. 공동 조직위원장으로는 성균관대 한진영 교수, University of South Florida의 Seungbae Kim 교수, The Pennsylvania State University 교수이자 성균관대 석학교수인 S. Shyam Sundar 교수, UCLA의 Wei Wang 교수가 참여했다. 멀티모달 파운데이션 모델의 책임성을 주제로 올해 처음 열린 이번 워크숍에는 한국, 미국, 중국, 싱가포르, 영국, 일본, 러시아, 브라질, 오스트레일리아, 인도, 이탈리아, 캐나다, 시에라리온 등 13개국에서 약 80명의 연구자가 참여했다. 성균관대학교, KAIST, UCLA, Peking University, Northwestern University 등 국내외 주요 대학을 비롯해 한국전자통신연구원(ETRI), 싱가포르 A*STAR 등 연구기관과 Google, Meta 등 글로벌 기업의 연구자들이 참석해 책임 있는 멀티모달 AI를 둘러싼 학계·연구기관·산업계의 국제적 논의를 이어갔다. 이번 워크숍에서는 멀티모달 대규모 언어모델(MLLM)이 데이터 분석과 지식 발견의 핵심 도구로 빠르게 활용되는 상황에서 모델의 편향과 취약성, 불투명한 의사결정 과정이 연구 결과의 신뢰성에 미치는 영향이 주요 의제로 다뤄졌다. 참석자들은 공정성과 해석가능성, 강건성을 단순한 윤리적 원칙을 넘어 신뢰할 수 있는 데이터 기반 지식 발견을 위해 해결해야 할 핵심 기술 과제로 바라보고 다양한 연구 결과와 접근법을 공유했다. 프로그램은 기조강연 2편과 초청강연 2편, 스포트라이트 발표, 두 차례의 포스터 세션으로 진행됐다. UCLA의 Yizhou Sun 교수는 “Multimodal Scientific Reasoning: Extending Foundation Models for Scientific and Engineering Discovery”를 주제로 파운데이션 모델이 다양한 형태의 정보를 종합해 복합적인 문제를 추론하고 과학·공학 분야의 새로운 발견을 지원할 수 있는 가능성과 향후 연구 방향을 제시했다. 이어 국회입법조사처 박소영 변호사는 “Legislating Responsible AI: Korea’s Basic Act and Beyond”를 주제로 인공지능 기본법을 중심으로 국내 AI 규범 체계를 소개하고, 빠르게 발전하는 AI 기술에 대응하기 위한 정책적 과제와 책임 있는 AI를 위한 제도적 방향을 제시했다. 두 편의 초청강연에서는 최신 연구 성과가 소개됐다. Beijing Institute of Technology의 Guo (Levick) Cheng은 지식그래프를 활용해 모델 추론의 신뢰성을 높이는 연구를, University of Technology Sydney의 Bo Peng은 사전학습 비전-언어 모델의 분포 외 데이터 탐지 성능을 향상시키는 연구를 각각 발표했다. 논문 발표 세션에서는 심사를 거쳐 채택된 22편의 연구가 두 차례의 포스터 세션을 통해 소개됐다. 각 세션에 앞서 연구의 핵심 내용을 소개하는 스포트라이트 발표가 진행됐으며, 포스터 세션에서는 멀티모달 모델의 신뢰성 평가와 편향 완화, 평가 데이터 구축, 모델 추론 등 다양한 주제를 놓고 활발한 논의가 이어졌다. 폐회에 앞서 열린 우수 논문 시상에서는 「PubTables-QA: A Benchmark Toward Cross-Page Table Reasoning in Table Visual Question Answering」이 최우수 논문상을 수상했다. 「AIRCL: Adaptive Importance-Weighted Retrieval Contrastive Learning for Hateful Meme Detection」은 우수 논문상을, 「EviRel: Evidence-Preserving Temporal Memory for Future Social Relation Reasoning in Videos」는 장려상을 각각 수상했다. 연구단은 이번 워크숍을 통해 형성된 국제 연구 네트워크를 바탕으로 참여 연구진과 공동연구 및 학술 교류를 이어갈 예정이다. 또한 향후 제2회 RespMultimodal 워크숍 개최를 추진해 책임 있는 멀티모달 AI 연구를 지속적인 국제 연구 의제로 발전시켜 나갈 계획이다. 신뢰가능한인공지능연구단 연구책임자인 한진영 교수는 “멀티모달 모델이 지식을 발견하고 해석하는 도구로 활용되기 시작한 만큼, 모델의 편향은 연구 결과와 데이터 기반 의사결정의 편향으로 이어질 수 있다”며 “이번 워크숍을 통해 세계 각국의 학계와 연구기관, 산업계 연구자들이 한자리에서 이 문제를 논의하고 다양한 연구 성과를 공유할 수 있었다”고 밝혔다. 이어 “앞으로도 국제 연구자들과의 공동연구와 학술 교류를 확대해 책임 있는 멀티모달 AI 연구가 데이터마이닝 분야의 핵심 국제 연구 의제로 발전하는 데 기여하겠다”고 말했다. 이번 워크숍은 과학기술정보통신부와 정보통신기획평가원(IITP)의 지원을 받아 수행되는 성균관대 신뢰가능한인공지능연구단 사업의 일환으로 마련됐으며, 발표 논문을 비롯한 자세한 정보는 공식 홈페이지에서 확인할 수 있다.
-
- 작성일 2026-08-27
- 조회수 213
-
- [연구] dxlab(지도교수 : 박은일), CIKM 2026 6편 논문 게재 승인
- [연구] dxlab(지도교수 : 박은일), CIKM 2026 6편 논문 게재 승인 Data eXperience Lab (dxlab, 지도교수: 박은일)의 논문이 데이터 마이닝 분야 top-tier 국제학술대회인 CIKM 2026*에 6편의 논문이 게재 승인되었습니다(Main 5편, Short 1편)! *35th ACM International Conference on Information and Knowledge Management Main Track 5편 1) 제목: When Explanations Seem Helpful but Fail to Help: Evaluating XAI Interfaces for Model Diagnosis Across Modalities Data eXperience Lab 박은일 교수 왼쪽부터 박선영(인공지능융합학과 박사과정), 박수범(실감미디어공학과 석사 졸업), 김세희(인공지능융합학과 석사 졸업) 키워드: Explainable AI, Model Diagnosis, Multimodal Information Systems, Decision Support Systems, Task-Grounded Evaluation 주요 내용: 설명 가능한 AI(XAI) 기법(LIME, SHAP 등)은 모델의 작동 방식을 해석하고 오류를 진단하기 위해 널리 도입되고 있습니다. 그러나 이러한 설명 인터페이스가 실제 사용자의 모델 오류 진단 능력을 향상시키는지, 그리고 이러한 유용성이 다양한 데이터 모달리티(Tabular, Text, Image) 전반에 일관되게 적용되는지는 명확하지 않았습니다. 본 논문은 108개의 모달리티별 사용자 실험 세션을 통해 주관적 인식(선호도, 이해도)과 과업 기반 행위 성과(오류 진단 정확도, 소요 시간)를 종합적으로 평가하여, XAI 인터페이스의 진단적 유용성이 모달리티별로 다르게 나타남을 밝힙니다. 핵심 기여 ■ XAI 주관적 인식과 실제 과업 성과 간의 불일치 규명 사용자들은 설명 인터페이스를 일관되게 선호하고 이해하기 쉬우며 유용하다고 평가했으나, 주관적 높은 평가가 실제 모델 오류 진단 정확도의 향상으로 항상 이어지지는 않는다는 비대칭성을 확인 ■ 모달리티에 따른 XAI 진단 유용성의 차별적 효과 검증 정형(Tabular) 데이터 환경에서는 LIME을 중심으로 설명의 진단적 효과가 가장 명확했던 반면, 텍스트(Text) 데이터에서는 진단적 이점이 없었고, 이미지(Image) 데이터에서는 방법론 간 차이만 나타남을 비교 검증 ■ 과업 중심 및 모달리티 민감 평가 기준 제시 설명 인터페이스 제공이 전 모달리티에 걸쳐 과업 수행 시간을 증가시켰음을 밝히고, 멀티모달 시스템에서 XAI의 품질을 단순 사용자 만족도가 아닌 과업 기반 및 모달리티 맞춤형 기준으로 평가해야 한다는 진단적 가이드라인 제안 모달리티 별, XAI 기법 별 차이를 나타낸 요약 결과 2. 제목: Less is More: Concise Retrieval and Critic-based Re-ranking for Composed Image Retrieval 왼쪽부터 정우첸(인공지능융합학과 박사과정), 안효주(실감미디어공학과 석사과정), 안형진(인공지능융합학과 박사과정) 키워드: Composed Image Retrieval, Zero-shot Learning, Chain-of-Thought Reasoning 주요 내용 제로샷 조합 이미지 검색(ZS-CIR)은 기준 이미지(Reference Image)와 수정 텍스트(Modification Text)를 결합하여 목표 이미지(Target Image)를 검색하는 기술입니다. 최근 접근 방식들은 대형 비전-언어 모델(LVLM)을 활용해 목표 이미지의 캡션을 생성하는 방식을 주로 사용하지만, 기존 방식이 생성한 캡션에는 불필요하거나 환각(Hallucination)된 세부 정보가 포함되어 검색 시 노이즈(Semantic Noise)를 유발하고 성능을 저하시키는 문제가 있습니다. 본 논문은 무분별한 세부 묘사를 억제하는 Concise Retrieval과 LVLM 기반 비평을 통해 정밀 재정렬을 수행하는 Critic Re-ranking을 결합한 2단계 학습 프리(Training-free) 프레임워크인 LM-CIR(Less-is-More CIR)을 제안합니다. 핵심 기여 ■ Concise Retrieval을 통한 노이즈 감소 기존의 장황한 캡션 생성 방식에서 벗어나, Concise CoT 프롬프팅을 통해 불필요한 세부 정보 및 부정어 표현을 배제하고 목표 이미지 검색에 핵심적인 최소한의 discriminative 캡션만을 생성하여 검색 시 발생하는 세만틱 노이즈를 효과적으로 감소시킴. ■ Critic Re-ranking 기반의 다각도 정밀 검증 LVLM을 평가자(Critic)로 활용하여 초기 검색된 상위 후보군에 대해 수정 의도 반영 여부(EDIT)와 기준 이미지의 핵심 속성 보존 여부(PRESERVE)를 명시적으로 평가 및 통합 점수화함으로써 텍스트-이미지 유사도 기반 검색의 한계를 보완하는 정밀 재정렬 메커니즘을 제안. ■ 세 가지 ZS-CIR 벤치마크에서 SOTA 성능 달성 CIRCO, CIRR, FashionIQ 데이터셋에서의 실험을 통해 별도의 추가 학습 없이 기존 제로샷 조합 이미지 검색 기법 대비 뛰어난 검색 성능 및 뛰어난 견고성(Robustness)을 달성함을 검증. 제안된 LM-CIR 프레임워크 요약 3. 제목: SAVER: Selective and Adaptive Multi-View Routing for Visual Emotion Reasoning in Vision-Language Models 왼쪽부터 이유빈(인공지능융합학과 석박통합과정), 이상은(ETRI, 인공지능융합학과 석사 졸), 차준엽(인공지능융합학과), Jufeng Yang(Nankai Univ.) 키워드: Visual Emotion Reasoning, Vision-Language Models, Multi-View Fusion, Selective Routing, Parameter-Efficient Fine-Tuning 주요 내용 시각적 감정 추론(Visual Emotion Reasoning)은 이미지 내의 다양한 시각적 요소를 종합하여 감정을 이해하는 과제입니다. 기존 방법들은 이미지를 단일 표현으로 처리하거나 모든 시각적 요소를 일률적으로 융합하여, 감정 형성에 기여하는 개별 시각 단서의 중요도를 맥락에 맞게 반영하지 못하고 노이즈가 개입하는 한계가 있었습니다. 본 논문은 텍스트 쿼리와 이미지 맥락에 맞춰 6가지 주요 시각 관점(얼굴 표정, 장면, 객체, 인간 행동, 색상, 밝기)의 중요도를 동적으로 선택 및 융합하는 SAVER(Selective and Adaptive Multi-View Routing) 프레임워크를 제안하여 감정 추론 성능과 해석 가능성을 정밀하게 향상시킵니다. 핵심 기여 ■ Selective & Adaptive Multi-View Routing 관점 제시 단일 이미지 표현이나 균일한 다중 관점 융합 방식에서 벗어나, 쿼리와 비전 맥락에 맞게 필요한 시각 단서를 동적으로 선택 및 가중치를 할당하여 통합하는 새로운 다중 관점 라우팅 구조 제안 ■ Semantic-Aware Router 및 Residual Fusion Structure 제안 이미지의 전역 비전 특징과 사용자 쿼리를 기반으로 관점별 중요도를 계산하는 의미 인지 라우터(Semantic-Aware Router)와, 특정 관점에 편향되거나 노이즈가 발생하는 것을 방지하는 잔차 융합(Residual Fusion) 메커니즘 구축 ■ 파라미터 효율적인 학습 및 최고 성능(SOTA) 달성 VLM 백본을 동결한 채 전체 파라미터의 약 0.30%만 학습하는 효율성을 극대화하였으며, 7개 주요 감정 분석 데이터셋에서 기존 비전 전용 모델 및 최신 VLM 기반 감정 추론 기법 대비 우수한 감정 추론 성능을 확인 제안된 SAVER 프레임워크 4. 제목: Auditing Multimodal Claims: A Controlled Reproducibility Study of Graph-Based Conversational Recommendation 저자: 박성현(이모션웨이브), 박혜림, 이정태, 최서인, 박은일(인공지능융합학과) 키워드: Conversational Recommender Systems, Multimodal Recommendation, Reproducibility Analysis, Graph-Based Recommendation 주요 내용 그래프 기반 대화형 추천 시스템(CRS) 분야에서는 최근 텍스트 및 지식 그래프 정보에 비전(이미지) 신호를 결합하여 추천 성능을 크게 향상시켰다고 보고하고 있습니다. 하지만 이러한 기존 모델들은 시각적 임베딩 도입, 결손된 이미지 노드의 0(Zero) 채움 처리, LLM 기반 합성 대화 데이터 추가 등을 동시에 적용하고 있어, 성능 향상이 순수 시각적 정보 덕분인지 아니면 데이터 증강 및 그래프 변형에 의한 착시인지 불분명했습니다. 본 논문은 기존 모델의 백본 구조와 학습 파이프라인을 동일하게 고정한 상태에서, 시각적 임베딩을 방해 조건(교란인자)으로 교체하거나 데이터 구성을 통제하는 재현성 감사(Controlled Reproducibility Audit)를 수행하여 실제 시각적 모달리티의 기여도를 정밀하게 검증합니다. 핵심 기여 ■ CRS 모달리티 기여도 검증을 위한 Distractor Audit 프레임워크 제안 이미지 임베딩을 가우시안 무작위 벡터, Zero 벡터, Shuffled-real 벡터 등 통제된 방해 조건(Distractor)으로 대체하여, 추천 성능 향상이 실제 아이템의 시각적 의미(Semantic)에서 기인한 것인지 검증하는 분석 방식 제시 ■ 시각적 정보와 대화 데이터 증강의 영향력 분리 및 비대칭성 규명 시각적 임베딩을 완전히 손상시킨 방해 조건에서도 기존 모델과 성능 차이가 거의 나타나지 않는 반면(R@10 편차 0.007 수준), LLM 생성 합성 대화 데이터를 추가했을 때는 명확한 성능 향상( )이 나타남을 확인하여 성능 개선의 주요 원인이 시각 신호가 아닌 데이터 증강임을 입증 ■ 멀티모달 CRS 평가를 위한 재현성 감사 프로토콜 제안 결손 데이터(Missingness)의 영향 및 검증 데이터셋 기준 체크포인트 선택(Valid-best) 규칙 등, 향후 그래프 기반 멀티모달 추천 시스템 연구에서 각 모달리티의 효과를 올바르게 평가하기 위한 엄격한 감사 절차 제시 제안된 감사/검증 절차 프레임워크 5. 제목: Latent Query Retrieval of Acoustic-Prosodic Evidence for Speech Toxicity Detection 왼쪽부터 김윤서(인공지능학과 석사과정), 박신유(인공지능융합학과 석사과정), 김지현(인공지능융합학과 석사과정) 키워드: Speech Toxicity Detection, Acoustic-Prosodic Evidence, Learnable Queries, Late Interaction Retrieval, Early Detection 주요 내용 Speech Toxicity Detection는 음성 기반 실시간 소통 환경에서 유해 발화를 빠르게 식별하기 위한 핵심 기술입니다. 기존 방법들은 음성을 텍스트로 변환(ASR)한 뒤 분류하거나 음성을 단일 임베딩으로 압축하는 방식을 주로 사용했으나, 이는 억양·어조·음색 등의 음향·운율적(Acoustic-Prosodic) 단서를 손실하고 ASR 오류 전파 및 지연 시간(Latency) 증가 문제를 야기했습니다. 본 논문은 ASR 텍스트 변환이나 사전 정의된 프롬프트 없이, 음성 토큰으로부터 독성 관련 국소 단서를 직접 검색(Retrieval)하는 학습 가능한 잠재 쿼리 기반 음향·운율 증거 검색 프레임워크를 제안합니다. 핵심 기여 ■ 잠재 쿼리 기반 음향·운율 증거 검색 관점 제안 음성 독성 탐지를 증거 검색 문제로 재정의하고, ASR 전사문 없이 음성 토큰에서 직접 독성/비독성 클래스별 국소 단서를 찾아내는 학습 가능한 잠재 쿼리(Learnable Latent Queries) 기반 Late Interaction 검색 구조 제안 ■ 효율적이고 낮은 지연 시간의 실시간 및 조기 독성 탐지 달성 ASR 기반 파이프라인 대비 추론 지연 시간(Mean Latency)을 175.24ms에서 15.43ms로 크게 단축하면서도, 발화 일부만 제공되는 조건(Prefix-Cropping)에서 우수한 조기 탐지 성능(AUPRC@50: 0.5115 0.6565) 달성 ■ 학습된 쿼리 기반 증거 및 메커니즘의 정밀 분석 Ablation, 쿼리 교란(Perturbation), 토큰 마스킹 분석 등을 통해 학습된 쿼리가 시간적으로 다양하고 클래스 특화된 음향·운율적 단서를 일관되게 포착하여 예측에 직접적으로 기여함을 입증 제안된 프레임워크; 스피치 정보를 근거로 사전 학습 없이 충분한 효과를 보이는 방법론 제시 Short Track 1편 6. 제목: CAPA: Context-Aware Prototype Adaptation for Weakly Supervised Histopathology Segmentation 왼쪽부터 안효주(실감미디어공학과 석사과정), 김희진(실감미디어공학과 석사과정) 키워드: Weakly supervised semantic segmentation, Histopathology segmentation, Prototype learning, Contrastive Learning 주요 내용 약지도 의미론적 분할(WSSS)은 병리 조직 이미지 분석에서 경계의 모호성, 클래스 간 시각적 유사성, 클래스 내 형태적 다양성, 패치 단위 처리 시 공간적 문맥 손실 등으로 인해 정확한 CAM(Class Activation Map)을 생성하는 데 어려움이 있습니다. 기존 방법들은 패치를 독립적으로 처리하거나 CAM 기반 표본의 신뢰도를 고려하지 않고 프롬프트를 학습하는 한계가 있었습니다. 본 논문은 공간적 이웃 문맥을 반영하는 Neighbor Context Attention(NCA)과 신뢰도 기반의 대조 학습을 수행하는 Reliability-Aware Contrastive Loss(RACL)를 결합하여 CAM의 품질과 분할 성능을 대폭 향상시킨 CAPA 프레임워크를 제안합니다. 핵심 기여 ■ 공간적 이웃 문맥을 활용한 NCA(Neighbor Context Attention) 제안 패치 경계를 넘어선 조직의 연속성을 반영하기 위해 인접 패치들의 특징을 교차 주의집중(Cross-Attention) 메커니즘으로 집일하여 중심 패치의 표현력을 강화 ■ 신뢰도 기반 대조 학습(RACL) 및 동적 프로토타입 업데이트 CAM으로 추출된 표본의 마진(Margin)을 바탕으로 신뢰도를 측정하고, 고신뢰도 표본 위주로 대조 학습 손실과 프로토타입 은행(Prototype Bank)을 동적으로 업데이트하여 노이즈 전파를 방지 ■ 병리 조직 분할 데이터셋에서 SOTA 성능 달성 BCSS-WSSS 및 LUAD-HistoSeg 데이터셋에서 기존 최상위 기법(PBIP) 대비 mIoU를 각각 +6.40%p, +4.15%p 향상시키며 우수한 분할 성능 검증 제안된 CAPA 프레임워크; 여러 패치의 활용으로 문맥 활용이 가능하여 성능 향상에 기여함. 해당 연구들은 과학기술정보통신부와 정보통신기획평가원의 대학ICT연구센터와 AI최고급신진연구자지원사업, 학석사연계지원사업으로 수행되었습니다.
-
- 작성일 2026-08-24
- 조회수 654
-
- [학생실적] DSSAL(지도교수: 김장현) 박사과정 강충원 학생: 2026 제1회 대학원 연구성과 경진대회 수상
- 우리 대학의 DSSAL(Data Science and Social Analysis Lab / 지도교수: 김장현) 소속 박사과정 강충원 학생이 2026 제1회 대학원 연구성과 경진대회+ (2026 Research Matters Plus)에서 장려상을 수상했습니다. DSSAL 소속 박사과정 강충원 학생 강충원 학생의 연구는 기존 멀티모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)의 탈옥(jailbreak) 취약성 연구가 이미지 입력에 집중되어 있다는 한계를 보완하고자, OpenAI 정책에서 규정한 13개의 규정 위반 범주를 포괄하는 비디오 데이터셋인 MCV-SafetyBench를 구축한 것입니다. 실험 결과, 비디오가 더 다양한 맥락을 포함하고 길이가 길어질수록 MLLMs의 탈옥 취약성이 증가하는 것으로 나타났습니다. 강충원 학생은 "이러한 결과는 비디오 입력의 특성을 고려한 MLLMs 안전성 정렬 연구가 필요함을 시사한다" 고 밝혔습니다.
-
- 작성일 2026-08-10
- 조회수 656
-
- [일반] 신뢰가능한인공지능연구단(지도교수: 한진영), KDD 2026서 <국제 워크숍: RespMultimodal 2026> 개최 (08.09. 일)
- 본 교의 신뢰가능한인공지능연구단(연구책임자 한진영 교수)이 오는 8월 9일 제주국제컨벤션센터(ICC 제주)에서 국제 워크숍 「RespMultimodal 2026: The First International Workshop on Responsible Multimodal Foundation Models for Knowledge Discovery」를 개최합니다. 이번 워크숍은 데이터마이닝 분야의 세계적 권위 학회인 ACM SIGKDD 2026과 연계해 열리며, 성균관대 신뢰가능한인공지능연구단을 중심으로 국내외 연구진이 공동으로 조직했습니다. 한진영 교수와 University of South Florida의 Seungbae Kim 교수, The Pennsylvania State University의 S. Shyam Sundar 교수, University of California, Los Angeles의 Wei Wang 교수가 공동 조직위원장(General Chair)을 맡았습니다. 멀티모달 파운데이션 모델의 책임성을 주제로 올해 처음 개최되는 국제 워크숍으로, KDD 2026이 국내에서 열리는 것을 계기로 책임 있는 멀티모달 AI에 관한 국제적 논의의 장을 마련했다는 데 의미가 있습니다. 워크숍은 텍스트와 이미지, 음성, 영상 등 다양한 형태의 정보를 통합적으로 처리하는 멀티모달 대규모 언어모델(MLLM)이 데이터 분석과 패턴 요약, 가설 생성의 핵심 도구로 자리 잡아가는 흐름에 주목합니다. 특히 모델의 편향과 취약성, 불투명한 의사결정 과정이 연구자가 데이터에서 무엇을 발견하고 어떻게 해석하는지에까지 영향을 미칠 수 있다는 문제의식에서 출발합니다. 공정성과 해석가능성, 강건성을 추상적인 윤리 담론에 머무르지 않고 데이터 기반 지식 발견의 신뢰성을 좌우하는 핵심 기술 과제로 다룬다는 것이 이번 워크숍의 기획 취지입니다. 프로그램은 기조강연 2편과 초청강연 2편, 스포트라이트 발표, 두 차례의 포스터 세션으로 구성됩니다. 첫 번째 기조강연에서는 University of California, Los Angeles의 Yizhou Sun 교수가 'Multimodal Scientific Reasoning: Extending Foundation Models for Scientific and Engineering Discovery'를 주제로, 파운데이션 모델을 과학·공학 분야의 발견 과정으로 확장하기 위한 멀티모달 추론 연구를 소개합니다. 두 번째 기조강연에서는 국회입법조사처 박소영 변호사가 'Legislating Responsible AI: Korea's Basic Act and Beyond'를 통해 인공지능 기본법을 중심으로 한 국내 AI 규범 체계와 향후 과제를 짚습니다. 초청강연에서는 Beijing Institute of Technology의 Guo (Levick) Cheng 교수가 지식그래프를 활용해 모델 추론의 충실성과 완결성을 높이는 방법론(Faico: Faithful and Complete Knowledge Graph Augmented Reasoning)을, University of Technology Sydney의 Bo Peng 교수가 사전학습된 비전-언어 모델의 분포 외 데이터 탐지 성능을 편향 보정을 통해 개선하는 연구(Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models)를 각각 발표할 예정입니다. 포스터 세션에서는 심사를 거쳐 채택된 22편의 논문이 두 세션에 걸쳐 발표됩니다. 각 연구의 핵심 내용을 짧게 소개하는 스포트라이트 발표도 함께 진행되며, 폐회에 앞서 우수 논문 시상식이 열립니다. 조직위원회에는 공동 조직위원장인 한진영 교수, Seungbae Kim 교수, S. Shyam Sundar 교수, Wei Wang 교수를 비롯해 Indiana University의 Haewoon Kwak 교수와 Jisun An 교수, 성균관대 홍성은 교수와 최윤석 교수, 국회입법조사처 박소영 변호사, 네이버 AI Lab 이승현 박사, 성균관대 김도하 박사가 참여합니다. 신뢰가능한인공지능연구단 연구책임자인 한진영 교수는 "멀티모달 모델이 지식을 발견하고 해석하는 도구로 활용되기 시작한 만큼, 모델의 편향은 연구 결과와 데이터 기반 의사결정의 편향으로 이어질 수 있다"며 "국내에서 개최되는 KDD 2026을 계기로 책임 있는 멀티모달 AI 연구가 데이터마이닝 분야의 핵심적인 국제 연구 의제로 자리 잡는 데 기여하고자 한다"고 밝혔습니다. 이번 워크숍은 과학기술정보통신부와 정보통신기획평가원(IITP)의 지원을 받아 수행되는 성균관대 신뢰가능한인공지능연구단 사업의 일환으로 마련됐으며, 자세한 프로그램과 발표 논문은 공식 홈페이지(respmultimodal2026.github.io)에서 확인할 수 있습니다.
-
- 작성일 2026-08-03
- 조회수 95
-
- [일반] 신뢰가능한 인공지능 연구단(지도교수: 한진영), 멀티모달 시대의 ‘책임 있는 AI’ 국제 심포지엄 성료
- 우리 대학의 신뢰가능한인공지능연구단(지도교수: 한진영) 주관으로 지난 7월 14일 인문사회과학캠퍼스 국제관 5층 R&E 라운지에서 「2026 International Symposium on Responsible AI」를 성황리에 개최하였습니다. 과학기술정보통신부와 정보통신기획평가원(IITP)의 후원으로 마련된 이번 심포지엄은, AI가 텍스트를 넘어 이미지와 상황 맥락까지 함께 이해하는 멀티모달 단계로 빠르게 확장되는 흐름에 주목했습니다. 모델이 사진 속 인물과 장면을 해석하는 과정에서 성별, 인종, 민족 등 사회적 단서에 근거한 왜곡된 판단을 내릴 수 있다는 우려가 커지는 만큼, 이러한 위험을 어떻게 진단하고 설계 단계에서 줄여나갈 것인지를 기술과 사회 양측의 시각에서 함께 짚는 자리로 구성되었습니다. 행사는 네 편의 기조강연을 중심으로 진행되었습니다. 성균관대 석학교수이자 지능형멀티미디어연구센터장인 시앰선더(S. Shyam Sundar) 교수(The Pennsylvania State University, Center for Socially Responsible AI 소장)는 알고리즘 편향에 대응하는 열쇠로 이용자의 미디어 리터러시를 제시하며, 기술적 보정에만 기대지 않고 이용자의 판단 역량을 키우는 접근의 필요성을 강조하였습니다. 이어 University of South Florida의 Seungbae Kim 교수는 생성형 AI가 만들어내는 정교한 가짜뉴스를 사례로 삼아, AI가 ‘설득력 있게 거짓을 말하는’ 능력이 책임 있는 AI 연구에 던지는 함의를 분석했습니다. 성균관대 송하연 교수는 이용자의 선호를 그대로 따르는 설계를 넘어 인간의 존엄성과 웰빙을 중심에 두는 AI 설계 원칙을 제안하였으며, Nanyang Technological University의 Jaehong Yoon 교수는 멀티모달 파운데이션 모델의 안전성과 책임성을 확보하기 위한 최신 연구 동향을 소개했습니다. 국내외 교수 및 학생 연구자 100여 명이 참석한 이번 행사는 인간 중심의 신뢰가능한 인공지능 실현을 위한 담론을 형성하고, 미래 기술의 윤리적 기준 마련을 위한 공감대를 넓히는 계기가 되었습니다. 아울러 이날 행사에서는 지난 6월 개최된 ‘2026 성균관대학교 멀티모달 AI Bias 챌린지’의 시상식과 상위 3개 팀의 수상 발표가 함께 진행되었습니다. 성균관대 지능형멀티미디어연구센터, 딥페이크연구센터, 실감미디어공학과가 주최하고 신뢰가능한인공지능연구단이 주관한 이번 대회에는 전국 대학(원)생 524명, 263팀이 참가했습니다. 대회는 이미지-텍스트 기반 질의응답 과제 단일 트랙으로 운영되어, 참가자들은 근거가 분명한 문항에서는 정확한 선택지를 예측하고 판단에 필요한 정보가 충분하지 않은 경우에는 섣불리 추론하지 않는 모델을 개발하였습니다. 정확도 향상에 초점을 맞추는 기존 경진대회와 달리, 성별과 인종, 민족 등 사회적 단서에 따라 AI의 판단이 달라지는 문제를 정면으로 다루었다는 점에서 차별화됩니다. 참가자들은 기술적 역량과 사회적 감수성을 동시에 요구받는 과제를 통해, AI 편향이라는 사회적 문제를 공학적 해법으로 풀어내는 경험을 쌓을 수 있었습니다. 신뢰가능한인공지능연구단 연구책임자인 한진영 교수는 “멀티모달 AI가 사람과 상황을 해석하는 단계로 발전하면서, 편향은 단순한 성능 문제가 아니라 실제 판단과 의사결정에 영향을 미치는 핵심적인 신뢰성 문제로 떠올랐다”며 “앞으로의 AI는 정확한 답을 내는 것뿐 아니라 판단의 근거를 제시하고, 정보가 충분하지 않을 때는 섣부른 추론을 유보할 수 있어야 한다. 이번 심포지엄과 챌린지가 기술적 성능과 사회적 책임을 함께 평가하는 새로운 기준을 만들어가는 출발점이 되기를 기대한다”고 밝혔습니다.
-
- 작성일 2026-07-31
- 조회수 100
-
- [연구] LAMDA연구실(지도교수: 오하영) RecSys 2026(1편), SIGIR 2026(1편), ISMAR 2026(1편), UIST 2026(1편) 총 논문 4편 채택
- - RecSys(ACM Conference on Recommender Systems) - SIGIR(ACM SIGIR Conference on Research and Development in Information Retrieval) - ISMAR(IEEE International Symposium on Mixed and Augmented Reality) - UIST(ACM Symposium on User Interface Software and Technology) 1)Choosing What Matters: Query-Aware Multimodal Routing for Conversational Recommendation / RecSys(Short paper) 왼쪽부터 LAMDA Lab 인공지능융합학과 석사과정 박혜림, 최서인, 심준보 학생(지도교수: 오하영) Conversational Recommender System(CRS) 분야에서 Query-Aware Multimodal Routing(QAMR-CRS) 모델을 제안하고 구현하였다. 기존 최신 멀티모달 추천 모델인 MSCRS는 지식그래프(Knowledge Graph), 공출현(Co-occurrence), 텍스트 유사도(Text Similarity), 이미지 유사도(Image Similarity) 정보를 활용하지만, 모든 대화 상황에서 동일한 방식으로 모달리티를 융합한다는 한계가 존재하였다. 이에 본 연구에서는 사용자의 현재 대화 문맥과 대화 내 언급된 개체 정보를 기반으로 질의(Query)를 표현하고, 각 질의에 대해 어떤 모달리티 정보가 가장 중요한지를 동적으로 판단하는 Query-Aware Routing 메커니즘을 설계하였다. 이를 위해 대화 표현과 개체 표현을 결합한 질의 벡터를 생성하고, 이를 기반으로 각 모달리티의 중요도를 예측하는 라우터를 구축하였다. 또한 특정 모달리티에 과도하게 의존하는 현상을 방지하기 위해 엔트로피 정규화(Entropy Regularization)를 적용하였으며, 기존 멀티모달 융합 정보와 동적 라우팅 결과를 결합하는 잔차 기반(Residual) 융합 구조를 도입하여 모델의 안정성과 일반화 성능을 향상시켰다. 2) PEARL: Profile-based Explainable Agent for Edge LLM Recommendation via Latent Decomposition / SIGIR(Short paper) LAMDA Lab 인공지능융합학과 석사과정 이진권 학생(지도교수 : 오하영) 본 연구는 사용자의 프로필을 기반으로 가장 적합한 20억 개 이하의 온디바이스 LLM을 선택하고 그 이유를 설명하는 PEARL 프레임워크를 제안한다. 기존 개인화 연구가 하나의 고정된 모델을 조정하는 데 집중한 것과 달리, PEARL은 사용자 선호와 과제 특성에 따라 서로 다른 엣지 모델을 추천한다. 이를 위해 클라우드 LLM과 엣지 LLM의 응답 차이를 공감성, 장르 이해도, 선호 반영 능력 등의 특성으로 요약하고, Explainable Latent Decomposition을 통해 해석 가능한 잠재 능력 공간으로 변환한다. 이후 사용자 프로필과 각 모델의 능력 좌표를 비교하여 가장 적합한 모델을 선택하고 자연어 설명을 생성한다. PersonaLens 데이터셋 실험에서 PEARL은 단일 도메인 개인화 점수 2.40, 다중 도메인 점수 2.26을 기록하여 최고 성능의 고정 모델보다 각각 0.28과 0.23 높은 성능을 보였다. 또한 주요 능력 차원을 제거했을 때 추천 결과의 73%가 변경되어, 생성된 설명이 실제 모델 선택에 직접 활용되는 신뢰할 수 있는 근거임을 확인하였다. 이러한 결과는 PEARL이 콜드스타트 환경에서 개인화된 온디바이스 LLM을 효과적이고 설명 가능하게 선택할 수 있음을 보여준다. 3) SPHERE: Adaptive VR Indoor Scene Generation via LLM-Enhanced Spatial Preference Learning and Human-in-the-Loop RL / TVCG(presented at ISMAR) (Full paper) LAMDA Lab 실감미디어공학과 석사과정 이현민 학생(지도교수: 오하영) 본 연구는 대형언어모델(LLM)을 활용한 3차원 실내 공간 생성 과정에서 사용자의 선호를 지속적으로 학습하고 반영하는 적응형 가상현실 생성 프레임워크인 SPHERE를 제안한다. 기존 3D 공간 생성 방식은 개별 세션 단위로 동작하여 사용자가 이전에 수행한 수정이나 공간 배치 선호를 유지하지 못하기 때문에, 새로운 공간을 생성할 때마다 동일한 수정 작업을 반복해야 하며 몰입형 환경에서 신체적 피로가 증가하는 한계가 있었다. SPHERE는 이러한 일회성 공간 생성을 사용자와 인공지능이 지속적으로 협력하는 인간-AI 공동 창작 과정으로 확장한다. SPHERE는 사용자의 음성 명령과 컨트롤러 기반 편집 행동에서 반복적으로 나타나는 공간 선호를 추출하고 이를 장기적으로 저장한다. 또한 개별 객체의 위치와 같은 단순한 편집 기록에 과도하게 의존하지 않도록, 사용자의 수정 행동을 지역적 기능 관계와 전역적 공간 구조를 포함하는 계층적 제약 조건으로 추상화한다. 이를 통해 공간의 크기나 형태가 변화하더라도 사용자의 기능적·위상적 배치 선호를 안정적으로 적용할 수 있다. 아울러 사용자가 최종적으로 편집한 장면을 피드백으로 활용하는 Human-in-the-Loop 강화학습 메커니즘을 도입하여, 사용자에게 적합한 공간 선호를 검색하는 정책을 지속적으로 갱신하도록 설계하였다. 총 42명을 대상으로 한 혼합 설계 사용자 실험과 오프라인 절제 실험을 수행한 결과, SPHERE는 기존 방식과 비교하여 사용자가 수행해야 하는 공간 수정 횟수와 신체적 부담을 유의하게 감소시켰다. 또한 단순한 객체 수준의 특성에 편향되지 않고 사용자의 기능적·공간적 선호가 반영된 개인화된 실내 레이아웃을 생성하는 것으로 나타났다. 이러한 결과는 SPHERE가 사용자의 지속적인 피드백을 기반으로 공간 생성 지능을 안전하고 신뢰성 있게 발전시키며, 몰입형 공간 설계에서 인간 중심의 지속적 공동 창작을 지원할 수 있음을 보여준다. 4) What If You Could Call Your Future Self? NicoCall as a Personalized Future-Self Video Call for Nicotine Cessation / UIST (Full paper) 왼쪽부터 LAMDA Lab 실감미디어공학과 석사과정 서주민, 졸업생 홍지흔, 인공지능융합학과 졸업생 김동명 학생 (지도교수 : 오하영) 본 연구는 니코틴 중독 금연을 지원하기 위해 AI 기반 미래자아와의 개인화된 비디오 통화 상호작용 시스템인 NicoCall을 제안한다. 기존의 금연 중재는 주로 일반적인 정보 제공이나 일방향 조언에 의존했으나, 금연의 핵심 어려움은 현재의 즉각적인 보상과 미래의 지연된 건강 이득 사이의 시간적 갈등이라는 점을 간과해왔다. 이를 해결하기 위해 본 연구에서는 ‘미래자아 연속성’ 이론에 기반하여, 사용자의 개인 정보(성격 특성, 가치관, 니코틴 의존성 지표)로부터 구축한 맞춤형 미래자아 페르소나를 시각화하고, 이와의 대화형 상호작용을 제공하는 시스템을 구현하였다. 특히 희망적 미래자아(성공적으로 금연한 긍정적 미래)와 두려운 미래자아(금연 실패로 인한 부정적 미래) 두 가지 상반된 프레이밍을 모두 지원하도록 설계하였다. 연구 방법론은 두 단계로 구성된다. 먼저 형성 연구를 통해 사용자들이 미래자아 상호작용을 어떻게 인식하는지 탐색하고, 신뢰성, 정서적 수용 가능성, 사용자 주체성 측면의 설계 요구사항을 도출하였다. 이를 바탕으로 LLM 기반 대화 생성, 사용자 사진으로부터의 3D 얼굴 재구성 및 나이 진행을 통한 시각적 미래 자신 생성, 조건별 대화 프레이밍 등을 구현하였다. 이후 본 실험에서는 희망적 자아, 두려운 자아, 대조군(표준 금연 교육 영상) 3가지 조건을 비교하는 무작위 배정 실험을 수행하였다. 주요 발견사항은 다음과 같다. NicoCall 상호작용 전반은 미래자아 연속성과 금연 자기효능감 증가, 흡연 갈망 감소와 관련되었다. 특히 희망적 미래자아 프레이밍은 미래자아 연속성과 자기효능감에서 더 일관되고 안정적인 심리적 변화를 보였으며, 1개월 후속 추적에서도 흡연 감소 효과가 더 잘 유지되었다. 반면 두려운 미래자아는 단기 흡연 감소에서 더 큰 즉각적 영향을 보였지만, 심리적 지속성과 장기 유지 측면에서는 혼합된 결과를 나타냈다. 질적 분석을 통해서는 미래자아가 사용자 자신의 목표와 경험을 반영할 때(개인적 적합성)와 상호작용이 생생한 사회적 현존감을 제공할 때 메시지 수용성이 높아짐을 확인하였다. 이는 미래자아 기반 중재의 효과가 단순한 정서적 충격이나 정보 내용이 아니라, 사용자가 그 미래자아를 자신으로 경험하는 정도에 달려 있음을 시사한다.
-
- 작성일 2026-07-15
- 조회수 1501
-
- [연구] 실감미디어공학과, 한국방송·미디어공학회 2026 하계학술대회서 우수 연구성과 입증
- 실감미디어공학과, 한국방송·미디어공학회 2026 하계학술대회 우수 연구성과 입증 SW융합대학 실감미디어공학과(원)가 지난 6월 18일부터 20일까지 제주특별자치도 서귀포시 롯데호텔 제주에서 열린 「2026 한국방송·미디어공학회 하계학술대회」에 참가해 우수한 연구성과를 선보이고 다수의 수상 실적을 거두며 학과의 연구 경쟁력을 입증했다. 한국방송·미디어공학회 하계학술대회는 방송미디어, 영상처리, 인공지능, 실감미디어, 차세대 콘텐츠 및 미디어 융합 기술 분야의 최신 연구성과를 공유하는 국내 대표 학술 행사다. 최근 생성형 인공지능, 몰입형 미디어, 3차원·4차원 콘텐츠, 초실감 영상, 지능형 방송 서비스 등 새로운 기술 패러다임이 빠르게 확산됨에 따라 500여 명의 산·학·연 연구자들이 한자리에 모여 미래 미디어 기술의 발전 방향을 논의하는 교류의 장으로 마련됐다. 특히 이번 학술대회는 우리 대학 실감미디어공학과 학과장인 류은석 교수가 조직위원장을 맡아 행사를 총괄 운영하며 성공적인 학술대회 개최를 이끌었다는 점에서 의미를 더했다. 학술대회에는 IITP, TTA, RAPA, ETRI, KETI, 삼성, KBS 등 주요 기관과 기업이 참여한 26개의 특별세션이 운영되었으며, 취·창업 세션과 신진연구자 발표 세션, 국제학술대회 최우수 논문 발표 세션 등을 통해 최신 연구 동향과 산업 현안을 공유했다. 실감미디어공학과는 학술대회 기간 중 특별세션 「실감미디어공학과 성과교류회」를 개최해 학과 소속 연구실의 주요 연구 주제와 연구 성과를 공유하고, 10명의 실감미디어공학과 교수진과 대학원생들이 함께 향후 연구 협력 및 발전 방향을 논의하는 시간을 가졌다. 생성형 인공지능, 컴퓨터 비전, XR(확장현실), 3차원 재구성, 멀티미디어 처리 등 다양한 분야의 연구 결과를 소개하며 학과의 우수한 연구 역량을 대내외에 알렸다. 이번 학술대회에서 실감미디어공학과는 학술대회 우수논문상 부문에서 뛰어난 성과를 거두었다. 포스터 부문 우수논문상에는 「관제 영상 자세 추정을 위한 합성 데이터 생성 및 평가 연구」(류문욱, 최종우, 송인표, 이장원)가 선정되어, 인공지능 기반 영상분석 분야의 우수성을 인정받았다. 또한 「다시점 색상 인식 초기화 기반 LiDAR 가우시안 스플래팅 기법」(양이삭, 김영규, 안승혁, 류은석)은 학술대회 대상에 선정되는 영예를 안았다. 해당 연구는 다중 시점 환경에서의 정밀한 3차원 공간 재구성 기술의 정확도와 효율성을 향상시킨 연구로 평가받으며 학술대회 최고 수준의 연구 성과로 인정받았다. (좌)학술대회 포스터부문 우수상 수상-관제 영상 자세 추정을 위한 합성 데이터 생성 및 평가 연구(류문욱, 최종우, 송인표, 이장원) (우)학술대회 대상 수상-다시점 색상 인식 초기화 기반 LiDAR 가우시안 스플래팅 기법(양이삭, 김영규, 안승혁, 류은석) 이번 성과는 실감미디어공학과가 인공지능과 실감미디어 분야에서 축적해 온 연구 역량과 교육 성과를 대외적으로 입증한 사례로 평가된다. 실감미디어공학과는 앞으로도 미래 미디어 기술을 선도하는 융합 연구를 지속적으로 추진하고, 글로벌 경쟁력을 갖춘 연구 인재 양성을 위해 노력할 계획이다. ※본 성과는 과학기술정보통신부와 정보통신기획평가원(IITP) 정보통신방송혁신인재양성사업 「가상융합대학원」과제 지원을 받아 수행된 연구결과입니다.
-
- 작성일 2026-06-23
- 조회수 338
발전기금


