LipGER:基于视觉条件的生成式错误纠正以提升自动语音识别鲁棒性
音频与语音处理
2024-06-10 v1 人工智能
计算与语言
摘要
视觉线索,如唇部运动,已被证明可提高自动语音识别(ASR)系统在噪声环境下的性能。我们提出了 LipGER(Lip Motion aided Generative Error Correction),一个新型框架,利用视觉线索实现面向噪声鲁棒的 ASR。我们不学习音频与视觉模态之间的跨模态相关性,而是让大语言模型学习视觉条件(生成式)ASR 错误纠正任务。具体而言,我们指示一个大语言模型从使用 ASR 束搜索生成的 N-best 假设中预测转录文本,并进一步以唇部运动为条件。该方法解决了传统 AVSR 学习中的关键挑战,如缺乏大规模配对数据集以及难以适应新领域。我们在多个数据集上进行实验,表明 LipGER 在词错误率(WER)上实现了 1.1%~49.2% 的提升。我们还发布了 LipHyp,一个大规模数据集,包含假设-转录对,并额外附带了唇部运动线索,以推动该领域的进一步研究。
引用
@article{arxiv.2406.04432,
title = {LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition},
author = {Sreyan Ghosh and Sonal Kumar and Ashish Seth and Purva Chiniya and Utkarsh Tyagi and Ramani Duraiswami and Dinesh Manocha},
journal= {arXiv preprint arXiv:2406.04432},
year = {2024}
}
备注
InterSpeech 2024. Code and Data: https://github.com/Sreyan88/LipGER