机器翻译指标与同声语音翻译人工评分的相关性
计算与语言
2023-06-02 v2 人工智能
摘要
已有若干关于人工评分与离线机器翻译(MT)评价指标(如BLEU、chrF2、BertScore和COMET)之间相关性的元评估研究。这些指标已被用于评估同声语音翻译(SST),但它们与近期作为连续评分(CR)收集到的SST人工评分的相关性尚不清楚。本文中,我们利用提交至IWSLT 2022英德SST任务的候选系统评测结果,对CR与上述指标进行了广泛的相关性分析。我们的研究表明,离线指标与CR具有良好相关性,可可靠用于评估同声模式下的机器翻译,但在测试集规模上存在一定限制。我们得出结论:鉴于当前SST的质量水平,这些指标可用作CR的替代,从而缓解大规模人工评测的需求。此外,我们观察到指标与翻译(作为参考)的相关性显著高于与同声传译的相关性,因此推荐使用前者进行可靠评估。
引用
@article{arxiv.2211.08633,
title = {MT Metrics Correlate with Human Ratings of Simultaneous Speech Translation},
author = {Dominik Macháček and Ondřej Bojar and Raj Dabre},
journal= {arXiv preprint arXiv:2211.08633},
year = {2023}
}
备注
IWSLT 2023