中文

LLM-based论点分类综合研究:从LLAMA到GPT-4o再到Deepseek-R1

计算与语言 2025-07-25 v2 人工智能

摘要

论点挖掘(AM)是一种交叉学科研究领域,融合了逻辑、哲学、语言学、修辞学、法学、心理学和计算机科学等领域的见解。它涉及自动识别和提取论证组件(如前提和主张),以及检测它们之间的关系,如支持、攻击或中性。近期,随着大型语言模型(LLM)的出现,尤其是GPT-4o和Deepseek-R1,AM领域取得了显著进展,尤其在分析和提取论证语义方面相较于传统方法和其他深度学习模型表现更佳。尽管已有许多基准用于测试和验证LLM的质量,但仍缺乏针对这些模型在公开可用的论点分类数据库中运行结果的研究。本文采用多样化的数据集(如Args.me和UKP),测试包括GPT、Llama和DeepSeek版本的模型,以及集成链路思考(Chain-of-Thoughts)算法的推理增强变体。结果表明,ChatGPT-4o在论点分类基准中表现最佳。对于具备推理能力的模型,Deepseek-R1显示出优势。然而,尽管GPT-4o和Deepseek-R1在各项指标上表现出色,但仍会发生错误。本文讨论所有模型最常见的错误。据我们了解,本工作是首次对所提及的数据集使用LLM和提示算法进行更广泛的分析。工作还显示了已知提示算法在论点分析中的一些弱点,同时指出了改进方向。本工作的增值在于对可用论点数据集进行深入分析,并展示其不足之处。

关键词

引用

@article{arxiv.2507.08621,
  title  = {A comprehensive study of LLM-based argument classification: from LLAMA through GPT-4o to Deepseek-R1},
  author = {Marcin Pietroń and Rafał Olszowski and Jakub Gomułka and Filip Gampel and Andrzej Tomski},
  journal= {arXiv preprint arXiv:2507.08621},
  year   = {2025}
}