ArgCMV:面向 LLM 时代的论点摘要基准测试
计算与语言
2025-08-28 v1
摘要
关键点提取是论点摘要中的重要任务,涉及从论点中提取高层级简短摘要。现有关键点提取方法大多在流行的 ArgKP21 数据集上进行评估。在本文中,我们指出 ArgKP21 数据集的一些主要局限性,并证明需要更具代表性的新基准来反映真实的人类对话。我们使用最先进的 LLM,从跨越 3000 多个主题的实际在线人类辩论中整理了一个新的论点关键点提取数据集 ArgCMV,包含约 12000 个论点。我们的数据集展现出更高的复杂性,如更长的共指论点、更多的主观话语单元以及比 ArgKP21 更广泛的主题范围。我们证明现有方法在 ArgCMV 上表现不佳,并通过实验现有基线和最新开源模型提供了广泛的基准测试结果。本工作引入了一个面向长上下文在线讨论的新关键点提取数据集,为下一代 LLM 驱动的摘要研究奠定基础。
引用
@article{arxiv.2508.19580,
title = {ArgCMV: An Argument Summarization Benchmark for the LLM-era},
author = {Omkar Gurjar and Agam Goyal and Eshwar Chandrasekharan},
journal= {arXiv preprint arXiv:2508.19580},
year = {2025}
}