LongEval:长文本摘要忠实性人工评估指南
计算与语言
2023-02-01 v1
摘要
尽管人工评估仍是准确判断自动生成摘要忠实性的最佳实践,但针对长文本摘要评估难度与工作量增加问题的解决方案寥寥无几。通过对 162 篇长文本摘要论文的调研,我们首先阐明了当前围绕长文本摘要的人工评估实践。我们发现其中 73% 的论文未对模型生成摘要进行任何人工评估,而其他工作则面临处理长文档时出现的新困难(例如标注者间一致性低)。受调研启发,我们提出 LongEval,一套用于长文本摘要忠实性人工评估的指南,应对以下挑战:(1)如何在忠实性分数上实现高标注者间一致性?(2)如何在保持准确忠实性分数的同时最小化标注者工作量?(3)人类是否受益于摘要与源片段间的自动对齐?我们在两个不同领域的长文本摘要数据集(SQuALITY 和 PubMed)上部署 LongEval 进行标注研究,发现转向更细粒度判断(如子句级)可降低忠实性分数的标注者间方差(如标准差从 18.5 降至 6.8)。我们还表明,细粒度单元的部分标注分数与完整标注工作量的分数高度相关(使用 50% 判断时 Kendall's tau 为 0.89)。我们发布人工判断、标注模板及作为 Python 库的软件以供未来研究。
引用
@article{arxiv.2301.13298,
title = {LongEval: Guidelines for Human Evaluation of Faithfulness in Long-form Summarization},
author = {Kalpesh Krishna and Erin Bransom and Bailey Kuehl and Mohit Iyyer and Pradeep Dasigi and Arman Cohan and Kyle Lo},
journal= {arXiv preprint arXiv:2301.13298},
year = {2023}
}
备注
EACL 2023 camera ready. Code and data can be found in https://github.com/martiansideofthemoon/longeval-summarization