在作者的一点帮助下:复现机器翻译错误检测器的人类评估
计算与语言
2023-08-15 v1
摘要
本工作展示了我们复现 Vamvas 和 Sennrich(2022)论文中所提出人类评估实验结果的努力,该实验评估了一个自动检测机器翻译(MT)输出中过译与漏译(即包含比原文更多或更少信息的翻译)的系统。尽管作者提供了高质量的文档与代码,我们仍讨论了在复现精确实验设置时发现的一些问题,并提出了改进可复现性的建议。我们复现的结果总体上证实了原研究的结论,但在某些情况下观察到了统计显著差异,表明人类标注具有高度变异性。
引用
@article{arxiv.2308.06527,
title = {With a Little Help from the Authors: Reproducing Human Evaluation of an MT Error Detector},
author = {Ondřej Plátek and Mateusz Lango and Ondřej Dušek},
journal= {arXiv preprint arXiv:2308.06527},
year = {2023}
}
备注
Submitted to https://www.aclweb.org/portal/content/repronlp-shared-task-reproducibility-evaluations-nlp-2023