双头合乎:基于双假说的音视语peech错误纠正
音频与语音处理
2025-10-16 v1 计算与语言
机器学习
摘要
本文提出一种新范式,用于音视语peech识别(AVSR)中的生成式错误纠正(GER)框架,直接在语言空间中推理多模态证据。我们的框架DualHyp使大型语言模型(LLM)能够从独立的自动语peech识别(ASR)和视觉语peech识别(VSR)模型中构建各自的N-best假设。为充分发挥DualHyp的效果,我们进一步引入RelPrompt,一种噪声感知的引导机制,为LLM提供模态依托化的提示,引导模型在ASR与VSR假设之间动态切换注意力,以实现精准纠正。在各种损坏情景下,我们的方法在LRS2基准上相对于标准ASR基线实现了最高57.7%的错误率提升,而单流G E R方法仅实现约10%的提升。为促进DualHyp框架内的研究,我们已在https://github.com/sungnyun/dualhyp发布代码及包含ASR与VSR假设的数据集。
引用
@article{arxiv.2510.13281,
title = {Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses},
author = {Sungnyun Kim and Kangwook Jang and Sungwoo Cho and Joon Son Chung and Hoirin Kim and Se-Young Yun},
journal= {arXiv preprint arXiv:2510.13281},
year = {2025}
}
备注
Preprint work