面向端到端语音翻译的非参数域自适应方法
计算与语言
2022-11-07 v6 人工智能
摘要
端到端语音翻译 (E2E-ST) 因其更少的错误传播、更低延迟和更少参数而受到越来越多的关注。然而,基于神经网络的方法在该任务上的有效性严重受限于可用的训练语料,尤其在域自适应中,领域内三元组训练数据稀缺或不存在。本文中,我们提出一种新颖的非参数方法,利用领域特定的文本翻译语料来实现 E2E-ST 系统的域自适应。为此,我们首先将额外的编码器融入预训练的 E2E-ST 模型以实现文本翻译建模,然后通过减小可用三元组训练数据中相应的表示失配来统一解码器对文本与语音翻译任务的输出表示。在域自适应期间,引入 k-近邻 (kNN) 分类器,利用由领域特定文本翻译语料构建的外部数据存储来生成最终翻译分布,同时采用通用输出表示进行相似度搜索。在 Europarl-ST 基准上的实验表明,当仅涉及领域内文本翻译数据时,我们提出的方法在所有翻译方向上平均比基线显著提升 12.82 BLEU,甚至优于强大的领域内微调方法。
引用
@article{arxiv.2205.11211,
title = {Non-Parametric Domain Adaptation for End-to-End Speech Translation},
author = {Yichao Du and Weizhi Wang and Zhirui Zhang and Boxing Chen and Tong Xu and Jun Xie and Enhong Chen},
journal= {arXiv preprint arXiv:2205.11211},
year = {2022}
}
备注
EMNLP 2022 main conference