中文

XLAVS-R:面向噪声鲁棒语音感知的跨语言音视频语音表征学习

声音 2024-08-13 v2 计算与语言 音频与语音处理

摘要

语音识别和翻译系统在噪声输入上表现不佳,而噪声输入在现实环境中频繁出现。用视觉信号增强这些系统具有提高噪声鲁棒性的潜力。然而,音视频(AV)数据仅能以有限数量获取,且覆盖的语言远少于纯音频资源。为弥补这一差距,我们提出XLAVS-R,一种跨语言音视频语音表征模型,用于在100多种语言中实现噪声鲁棒的语音识别和翻译。该模型旨在通过建立在纯音频多语言预训练之上并简化现有预训练方案,最大化有限多语言AV预训练数据的收益。在MuAViC基准上的广泛评估显示了XLAVS-R在下游音视频语音识别和翻译任务上的优势,在给定噪声AV输入时,其性能比先前最优技术分别高出最多18.5%的词错误率(WER)和4.7 BLEU值,并能通过纯音频微调实现强大的零样本音视频能力。

关键词

引用

@article{arxiv.2403.14402,
  title  = {XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception},
  author = {HyoJung Han and Mohamed Anwar and Juan Pino and Wei-Ning Hsu and Marine Carpuat and Bowen Shi and Changhan Wang},
  journal= {arXiv preprint arXiv:2403.14402},
  year   = {2024}
}

备注

ACL2024