中文

为何我们需要语音来评估语音翻译

计算与语言 2026-05-28 v1

摘要

语音翻译模型日益擅长保留语音特定信息(如说话人性别、韵律和强调),然而评估指标对此类现象却视而不见。我们对两套对抗数据集进行了质量评估,分别针对性别一致性和韵律问题,发现即使获得语音信号,基于文本和语音的质量估计方法均表现不佳。我们随后训练了SpeechCOMET,一组带语音编码器的质量估计模型,并评估了最新的SpeechLLM作为评判器。两者在标准质量估计任务中与基于文本的COMET相当或更好,但Neither持续评估语音特定现象。我们识别出三个原因:(1)语音特定特征在当前编码器中未被可靠保留,(2)模型倾向于忽略语音来源信号,(3)质量估计训练数据中相关示例数量不足。我们公开所有模型和代码,认为进步需要专门的语音特定训练数据以及真正基于语音的模型。

关键词

引用

@article{arxiv.2605.28227,
  title  = {Why We Need Speech to Evaluate Speech Translation},
  author = {Maike Züfle and Danni Liu and Vilém Zouhar and Jan Niehues},
  journal= {arXiv preprint arXiv:2605.28227},
  year   = {2026}
}