中文

推理与否?推理大语言模型在对话摘要任务中的全面评估

计算与语言 2025-07-04 v1 人工智能

摘要

对话摘要是一项具有挑战性的任务,在客户服务、会议分析和对话式 AI 中具有重要实用价值。尽管大语言模型在摘要任务中取得了显著进展,但对于需要同时进行抽象和简明的对话场景,逐步推理架构——特别是如 OpenAI-o1 和 DeepSeek-R1 等长思维链实现——的性能仍未被探索。在这项工作中,我们首次对最先进的推理 LLM 和非推理 LLM 在三大主要范式(通用、面向角色和面向查询的对话摘要)上进行了全面系统的评估。我们的研究涵盖了多种语言、领域和摘要长度,利用了强大的基准测试(SAMSum、DialogSum、CSDS 和 QMSum)以及先进的评估协议,包括基于 LLM 的自动指标和受人类启发的标准。与其他推理密集型任务的趋势相反,我们的研究结果表明,显式的逐步推理并不总能提高对话摘要质量。相反,与非推理模型相比,推理 LLM 经常容易出现冗长、事实不一致和摘要不够简明的问题。通过特定场景分析和详细的案例研究,我们进一步明确了在复杂对话环境中,显式推理何时以及为何可能无法有益于——甚至阻碍——摘要任务。我们的工作为当前推理 LLM 的局限性提供了新见解,并强调了针对真实世界对话摘要进行针对性建模和评估策略的必要性。

关键词

引用

@article{arxiv.2507.02145,
  title  = {Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization},
  author = {Keyan Jin and Yapeng Wang and Leonel Santos and Tao Fang and Xu Yang and Sio Kei Im and Hugo Gonçalo Oliveira},
  journal= {arXiv preprint arXiv:2507.02145},
  year   = {2025}
}