重访句子并集生成作为文本整合的测试平台
计算与语言
2023-05-26 v1
摘要
基于多输入文本的文本生成任务,如多文档摘要、长形式问答以及当代对话应用,对模型正确整合部分重叠的多文本信息的能力提出了挑战。然而,这些任务将整合阶段与通常主观且定义不清的内容选择需求纠缠在一起,阻碍了对模型整合能力的恰当评估。本文中,我们建议重访句子并集生成任务,将其作为评估文本整合能力的有效且定义良好的测试平台,使整合挑战与主观内容选择解耦。为支持该任务的研究,我们提出了改进的标注方法与众包句子并集的工具,创建了迄今最大的并集数据集,并分析了其对各类整合维度的丰富覆盖。随后,我们提出了全面的并集生成评估协议,包含人工与自动评估。最后,作为基线,我们在该任务上评估了最先进的语言模型,并详细分析了它们应对多文本整合挑战的能力及其局限。
引用
@article{arxiv.2305.15605,
title = {Revisiting Sentence Union Generation as a Testbed for Text Consolidation},
author = {Eran Hirsch and Valentina Pyatkin and Ruben Wolhandler and Avi Caciularu and Asi Shefer and Ido Dagan},
journal= {arXiv preprint arXiv:2305.15605},
year = {2023}
}
备注
Findings of the Association for Computational Linguistics (ACL 2023)