BLASER:一种无文本语音到语音翻译评测指标
计算与语言
2022-12-19 v1
摘要
端到端语音到语音翻译(S2ST)通常用基于文本的度量指标来评估。这意味着生成的语音必须被自动转录,使得评测依赖于自动语音识别(ASR)系统的可用性与质量。在本文中,我们提出一种用于端到端 S2ST 的无文本评测指标,名为 BLASER,以避免对 ASR 系统的依赖。BLASER 利用一个多语言多模态编码器将源输入、翻译输出和参考的语音段直接编码到一个共享嵌入空间中,并计算可用作人工评测替代的翻译质量分数。为评估我们的方法,我们基于覆盖七个语言方向的超过 4 万条人工标注构建了训练集与评测集。BLASER 的最佳结果通过来自人工评分的监督训练取得。我们表明,在句子级评测时,BLASER 与人工判断的相关性在所有翻译方向上都显著优于包括 ASR-SENTBLEU 在内的依赖 ASR 的指标,并在其中五个方向上优于 ASR-COMET。我们的分析显示,将语音与文本作为 BLASER 的输入并不会增加与人工分数的相关性,而使用语音时取得最佳相关性,这印证了我们研究的目标。此外,我们表明在基于文本的度量中使用 ASR 生成参考是有害的。
引用
@article{arxiv.2212.08486,
title = {BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric},
author = {Mingda Chen and Paul-Ambroise Duquenne and Pierre Andrews and Justine Kao and Alexandre Mourachko and Holger Schwenk and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2212.08486},
year = {2022}
}