摘要评估能否在翻译到其他语言后保持有效?
计算与语言
2021-12-09 v2
摘要
构建高质量的摘要数据集是一项昂贵且耗时的工程,需要训练有素的人类与机器共同产出并评估摘要。若此类工作在一种语言中完成,若能在不重复人工标注的情况下将其用于其他语言将大有裨益。为探究我们对这类数据集的机器翻译可信任到何种程度,我们将英文数据集SummEval翻译为七种语言,并比较各类自动评估指标下的表现。我们探索将等价性检验作为评估摘要人机评分相关性的合适统计范式。虽然我们发现对于与源语言相似的语言,数据集复用存在一定潜力,但大多数摘要评估方法在跨翻译时并未被发现具有统计等价性。
引用
@article{arxiv.2109.08129,
title = {Does Summary Evaluation Survive Translation to Other Languages?},
author = {Spencer Braun and Oleg Vasilyev and Neslihan Iskender and John Bohannon},
journal= {arXiv preprint arXiv:2109.08129},
year = {2021}
}
备注
9 pages, 6 figures, 1 table, 3 appendixes