SEAHORSE:一个多语言、多维度的摘要评测数据集
计算与语言
2023-11-03 v2
摘要
由于摘要任务的多维度与主观性本质,可靠的自动摘要系统评测具有挑战性。对于英语以外的语言而言尤其如此,因为那里人工评测十分匮乏。在本工作中,我们引入了 SEAHORSE,一个用于多语言、多维度摘要评测的数据集。SEAHORSE 包含 96K 个摘要,带有沿 6 个文本质量维度的人工评分:可理解性、重复性、语法、归因性、主要观点和简洁性,覆盖 6 种语言、9 个系统和 4 个数据集。由于其规模与范围,SEAHORSE 既可作为评测习得度量的基准,也可作为训练此类度量的大规模资源。我们展示了用 SEAHORSE 训练的度量在域外元评测基准 TRUE(Honovich 等,2022)和 mFACE(Aharoni 等,2022)上取得了强劲性能。我们公开了 SEAHORSE 数据集与度量,以供未来多语言、多维度摘要评测研究使用。
引用
@article{arxiv.2305.13194,
title = {SEAHORSE: A Multilingual, Multifaceted Dataset for Summarization Evaluation},
author = {Elizabeth Clark and Shruti Rijhwani and Sebastian Gehrmann and Joshua Maynez and Roee Aharoni and Vitaly Nikolaev and Thibault Sellam and Aditya Siddhant and Dipanjan Das and Ankur P. Parikh},
journal= {arXiv preprint arXiv:2305.13194},
year = {2023}
}