中文

你站在哪一边?面向端到端论点摘要与评估的多任务数据集

计算与语言 2024-08-21 v3 机器学习

摘要

随着大型语言模型(LLM)的最新进展,构建一个帮助人们综合有说服力论点的自动辩论系统已不再遥不可及。先前的工作通过集成多个组件来尝试此任务。在我们的工作中,我们引入了一个论点挖掘数据集,该数据集捕捉了为辩论准备议论文的端到端过程,涵盖了主张和证据识别(任务1 ED)、证据说服力排序(任务2 ECR)、议论文摘要和人类偏好排序(任务3 ASR)以及基于人类对论证质量维度的反馈,用于自动评估生成论文的度量学习(任务4 SQE)。我们的数据集包含14k个主张示例,这些示例完全标注了支持上述任务的各种属性。我们为每个任务评估了多个生成基线,包括代表性的LLM。我们发现,虽然它们在我们的基准测试中的个别任务上显示出有希望的结果,但它们在连续完成所有四个任务时的端到端性能显著下降,无论是在自动度量还是在以人为中心的评估中。我们提出的数据集所带来的这一挑战,激励了未来关于端到端论点挖掘和摘要的研究。该项目的仓库可在https://github.com/HaoBytes/ArgSum-Datatset获取。

关键词

引用

@article{arxiv.2406.03151,
  title  = {Which Side Are You On? A Multi-task Dataset for End-to-End Argument Summarisation and Evaluation},
  author = {Hao Li and Yuping Wu and Viktor Schlegel and Riza Batista-Navarro and Tharindu Madusanka and Iqra Zahid and Jiayan Zeng and Xiaochi Wang and Xinran He and Yizhi Li and Goran Nenadic},
  journal= {arXiv preprint arXiv:2406.03151},
  year   = {2024}
}

备注

Published on ACL 2024 Findings