连续评分作为同声语音翻译的可靠人工评估
计算与语言
2024-11-15 v2
摘要
同声语音翻译(SST)可在模拟在线事件上评估,其中人工评估者观看带字幕视频并通过按键持续表达其满意度(即所谓的连续评分(Continuous Rating))。连续评分易于收集,但人们对其可靠性或 SST 用户对外语文档理解的关系知之甚少。在本文中,我们将连续评分与针对具有不同源语言知识水平的评判者的实况问卷进行对比。我们的结果表明,若评判者至少具备有限的源语言知识,连续评分是一种简单且可靠的 SST 质量评估方法。我们的研究指出了用户对字幕布局和呈现风格的偏好,并且最重要的是,提供了显著证据:具有较高源语言知识的用户偏好低延迟而非更少的重新翻译。
引用
@article{arxiv.2203.02458,
title = {Continuous Rating as Reliable Human Evaluation of Simultaneous Speech Translation},
author = {Dávid Javorský and Dominik Macháček and Ondřej Bojar},
journal= {arXiv preprint arXiv:2203.02458},
year = {2024}
}
备注
Published at WMT 2022: https://aclanthology.org/2022.wmt-1.9/