서강대 이혁준 교수팀 자연어처리 국제학술대회 'EMNLP 2026' 논문 채택.. '추가 학습 없이 음성인식 추론 효율 높여'
서강대 컴퓨터공학과 이혁준 교수 연구팀 논문이 자연어처리 국제학술대회 'EMNLP 2026 Findings'에 채택됐다. 논문 제목은 'RAMP: Regime-Aware Merge–Prune Token Compression for ASR-Oriented Audio-Language Models'이며, 정재한 석사과정이 제1저자, 이태한 박사과정이 공동저자, 이혁준 교수가 교신저자로 참여했다. RAMP는 오디오 인코더 단계에서는 유사한 토큰을 합치고, 프로젝터 이후 단계에서는 음성인식에 중요한 토큰만 남기는 방식으로 단계별로 다른 압축 전략을 적용한다. 모델 구조나 학습 과정을 바꾸지 않고 별도의 추가 학습 없이 적용할 수 있으며, attention map을 쓰지 않아 Flash Attention 기반 추론 환경과도 호환된다. 검증은 Audio-Flamingo-3와 Qwen2.5-Omni-7B 두 모델, 7개 음성인식 벤치마크로 이뤄졌다. Audio-Flamingo-3에서 오디오 토큰을 40%만 유지한 조건에서 RAMP의 평균 WER 배율은 2.36배로 비교 기법의 4.26배보다 낮았고, 기본 모델 대비 TTFT는 24.8% 단축됐다.
확인할 것
오디오 토큰을 40%만 남겨도 RAMP의 WER 배율이 2.36배에 그쳤다는 수치는 비교 기법의 4.26배보다 오류 증가폭이 작아, 이 압축 방식이 정보 손실을 상대적으로 덜 발생시킨다는 근거다. 추가 학습 없이 적용되고 attention map을 쓰지 않아 Flash Attention 기반 추론 환경과도 호환된다는 점은, 기존에 운용 중인 오디오-언어 모델에 재학습 없이 바로 적용 가능한지를 확인할 대목이다.
숫자로 보기
| 오디오 토큰 유지 비율 | 40% | Audio-Flamingo-3 기준 실험 조건 |
|---|---|---|
| RAMP 평균 WER 배율 | 2.36배 | |
| 비교 기법 평균 WER 배율 | 4.26배 | |
| TTFT 단축률 | 24.8% | 기본 모델 대비 |
| 검증 벤치마크 수 | 7개 | 음성인식 벤치마크 |
수치는 원문에 나온 값만 싣습니다. 원문에 없는 값은 자동으로 걸러집니다.
EMNLP 2026서강대오디오-언어 모델토큰 압축
전문은 싣지 않습니다. 원문의 저작권은 베리타스알파에 있습니다.
원문 보기 →