见懂上下文:基于多模态推理的富含视觉上下文的语音识别
声音
2026-03-10 v1 音频与语音处理
摘要
音频-视觉语音识别(AVSR)是ASR的一个延伸,纳入了视觉信号。当前的AVSR方法主要关注唇部动作,很大程度上忽略了视频中丰富的上下文信息,如说话场景和屏幕上的文本。为解决此问题(即包含丰富视觉上下文的AVSR,简称CAVSR),我们提出了VASR,通过“看到”并对视觉上下文进行推理来提高语音识别。具体而言,我们构建了一个强制 acoustic signals 与 visual evidence 之间进行中间跨模态对齐的 Audio-Visual Chain-of-Thought(AV-CoT),该证据驱动的推理缓解了“单模态主导”问题,即模型要么过度依赖视觉上下文,要么未能有效利用它。此外,为解决数据稀缺问题,我们构建并公开了相应的数据管道和测试集。实验表明,AV-CoT有效缓解了单模态主导问题,在CAVSR中实现了最好的性能。该项目已开源。
引用
@article{arxiv.2603.07263,
title = {Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning},
author = {Wenjie Tian and Mingchen Shao and Bingshen Mu and Xuelong Geng and Chengyou Wang and Yujie Liao and Zhixian Zhao and Ziyu Zhang and Jingbin Hu and Mengqi Wei and Lei Xie},
journal= {arXiv preprint arXiv:2603.07263},
year = {2026}
}