Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion

  • Lim, DongHoon
  • Kim, YoungChae
  • Kim, Dong-Hyun
  • Yang, Da-Hee
  • Chang, Joon-Hyuk
Citations

SCOPUS

0

초록

Robust audio-visual speech recognition (AVSR) in noisy environments remains challenging, as existing systems struggle to estimate audio reliability and dynamically adjust modality reliance. We propose router-gated cross-modal feature fusion, a novel AVSR framework that adaptively reweights audio and visual features based on token-level acoustic corruption scores. Using an audio-visual feature fusion-based router, our method down-weights unreliable audio tokens and reinforces visual cues through gated cross-attention in each decoder layer. This enables the model to pivot toward the visual modality when audio quality deteriorates. Experiments on LRS3 demonstrate that our approach achieves an 16.51-42.67% relative reduction in word error rate compared to AV-HuBERT. Ablation studies confirm that both the router and gating mechanism contribute to improved robustness under real-world acoustic noise.

키워드

Audio-Visual Speech RecognitionCross-Modal FusionNoise-Robust ASRRouter-Gated Cross AttentionAudio acousticsAudio signal processingAudio systemsRoutersSound reproductionSpeech communicationSpeech recognition
제목
Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion
저자
Lim, DongHoonKim, YoungChaeKim, Dong-HyunYang, Da-HeeChang, Joon-Hyuk
DOI
10.1109/ASRU65441.2025.11434748
발행일
2026-04
유형
Conference paper
저널명
ASRU 2025 - 2025 IEEE Automatic Speech Recognition and Understanding Workshop
페이지
1 ~ 7