中文

大语言时代下的论点摘要及其评估

计算与语言 2025-10-10 v4

摘要

大型语言模型 (LLM) 已在各类自然语言生成 (NLG) 任务中实现革命性突破,包括论点摘要 (Argument Summarization, ArgSum),后者是论点挖掘 (Argument Mining) 的关键子领域。本文探讨了将最先进的 LLM 集成到 ArgSum 系统中及其评估的工作。具体而言,我们提出了一种新颖的基于提示词的评估方案,并通过一个新颖的人类基准数据集进行验证。我们的工作作出了三项主要贡献:(i) 将 LLM 集成到现有 ArgSum 系统中;(ii) 开发两个新的 LLM-based ArgSum 系统,与先前方法进行基准测试;(iii) 引入一种先进的 LLM-based 评估方案。我们展示了 LLM 在论点摘要的生成与评估方面的显著提升,实现了最先进的结果,推动了 ArgSum 领域的发展。我们还显示,在 (i) 和 (ii) 中集成的四个 LLM 中,Qwen-3-32B 虽然参数最少,却表现最佳,甚至超越了 GPT-4o。

关键词

引用

@article{arxiv.2503.00847,
  title  = {Argument Summarization and its Evaluation in the Era of Large Language Models},
  author = {Moritz Altemeyer and Steffen Eger and Johannes Daxenberger and Yanran Chen and Tim Altendorf and Philipp Cimiano and Benjamin Schiller},
  journal= {arXiv preprint arXiv:2503.00847},
  year   = {2025}
}

备注

EMNLP 2025 Main Camera-ready