VAPO:基于 Omni-modal 大语言模型的全链路板墙增强语音识别
音频与语音处理
2026-04-28 v2 计算机视觉与模式识别
声音
摘要
Omni-modal 大语言模型(OLLM)因内在的多模态能力,提供了板墙增强语音识别的端到端解决方案。然而,我们发现 OLLM 面临一个根本问题:视觉干扰,模型对可见文本敏感,倾向于忽略听觉信号,导致幻觉生成从未被提及的板墙内容。为此,我们提出了 Visually-Anchored Policy Optimization(VAPO),旨在重塑模型的推理过程,遵循类人“观察-倾听”推理链。具体而言,我们设计了时序解耦的策略:模型首先在 χ 块中提取视觉先验作为语义锚点,然后在 <answer> 块中生成转录文本。该策略通过多目标强化学习进行优化。进一步,我们引入了 SlideASR-Bench,一个综合性基准旨在解决实体丰富数据稀缺问题,包含大规模合成语料用于训练和具挑战性的真实世界测试集用于评估。我们进行了广泛评估,表明 VAPO 有效消除了视觉干扰,在 SlideASR-Bench 和公开数据集上实现了最先进性能,显著降低了专业领域中实体识别错误。
引用
@article{arxiv.2510.08618,
title = {VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models},
author = {Rui Hu and Delai Qiu and Yining Wang and Shengping Liu and Jitao Sang},
journal= {arXiv preprint arXiv:2510.08618},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference