利用辅助语音与文本数据改进端到端语音翻译
音频与语音处理
2022-12-06 v1 人工智能
计算与语言
声音
摘要
我们提出一种将文本编码器引入预训练端到端语音翻译系统的方法。它增强了将一种模态(即源语言语音)适配到另一种模态(即源语言文本)的能力。因此,语音翻译模型可以从无标注和有标注数据中学习,尤其在源语言文本数据丰富时。此外,我们提出一种去噪方法以构建能够处理正常与噪声文本数据的鲁棒文本编码器。我们的系统在 MuST-C En-De、En-Fr 和 LibriSpeech En-Fr 任务上取得了新的最优结果(state-of-the-art)。
引用
@article{arxiv.2212.01778,
title = {Improving End-to-end Speech Translation by Leveraging Auxiliary Speech and Text Data},
author = {Yuhao Zhang and Chen Xu and Bojie Hu and Chunliang Zhang and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2212.01778},
year = {2022}
}
备注
Accepted to AAAI 2023