中文

AV-TranSpeech:音视觉鲁棒语音到语音翻译

计算与语言 2023-05-25 v1 声音 音频与语音处理

摘要

直接语音到语音翻译(S2ST)旨在将一种语言的语音转换为另一种语言的语音,迄今已取得显著进展。尽管近期取得成功,当前的 S2ST 模型在噪声环境中仍会出现明显的性能退化,且无法翻译视觉语音(即嘴唇与牙齿的运动)。在这项工作中,我们提出 AV-TranSpeech,这是首个不依赖中间文本的音频-视觉语音到语音(AV-S2ST)翻译模型。AV-TranSpeech 以视觉信息补充音频流,以提升系统鲁棒性,并开启了一系列实际应用:口述记录或对存档影片进行配音。为缓解并行 AV-S2ST 数据有限所带来的数据稀缺问题,我们 1)探索利用无标注音视觉数据进行自监督预训练以学习上下文表示,以及 2)引入跨模态蒸馏,结合在纯音频语料上训练的 S2ST 模型,进一步降低对视觉数据的需求。在两种语言对上的实验结果表明,无论噪声类型如何,AV-TranSpeech 在所有设定下均优于纯音频模型。在低资源音视觉数据(10h、30h)下,跨模态蒸馏相较基线平均带来 7.6 BLEU 的提升。音频样本见 https://AV-TranSpeech.github.io

关键词

引用

@article{arxiv.2305.15403,
  title  = {AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation},
  author = {Rongjie Huang and Huadai Liu and Xize Cheng and Yi Ren and Linjun Li and Zhenhui Ye and Jinzheng He and Lichao Zhang and Jinglin Liu and Xiang Yin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2305.15403},
  year   = {2023}
}

备注

Accepted to ACL 2023