MixSpeech:基于视听流混合的跨模态自学习用于视觉语音翻译与识别
计算机视觉与模式识别
2023-03-10 v1 计算与语言
摘要
多媒体通信促进了人们之间的全球互动。然而,尽管研究者们已经探索了机器翻译和音频语音翻译等跨语言翻译技术以克服语言障碍,关于视觉语音的跨语言研究仍然匮乏。这一研究缺失主要源于缺乏包含视觉语音与翻译文本配对的数据集。在本文中,我们提出 AVMuST-TED,首个用于音频-视觉多语言语音翻译(Audio-Visual Multilingual Speech Translation)的数据集,其来源于 TED 演讲。尽管如此,视觉语音不如音频语音易于区分,难以建立从源语音音素到目标语言文本的映射。为解决此问题,我们提出 MixSpeech,一种利用音频语音来正则化视觉语音任务训练的跨模态自学习框架。为进一步缩小跨模态差距及其对知识迁移的影响,我们建议采用由音频与视觉流插值生成的混合语音,并结合课程学习策略按需调整混合比例。MixSpeech 增强了噪声环境下的语音翻译,在 AVMuST-TED 上将四种语言的 BLEU 分数提升了 +1.4 至 +4.2。此外,它在 CMLR(11.1%)、LRS2(25.5%)和 LRS3(28.0%)上的唇读任务中取得了最先进的性能。
引用
@article{arxiv.2303.05309,
title = {MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition},
author = {Xize Cheng and Linjun Li and Tao Jin and Rongjie Huang and Wang Lin and Zehan Wang and Huangdai Liu and Ye Wang and Aoxiong Yin and Zhou Zhao},
journal= {arXiv preprint arXiv:2303.05309},
year = {2023}
}
备注
https://github.com/Exgc/AVMuST-TED