中文

文本摘要的实证比较:大型语言模型的多维评估

计算与语言 2025-04-08 v1 人工智能 机器学习

摘要

文本摘要对于缓解新闻、医学和商业等领域的信息过载至关重要。本研究使用一种新颖的多维评估框架,评估了17个大型语言模型(OpenAI、Google、Anthropic、开源模型)的摘要性能。我们在七个不同的数据集(BigPatent、BillSum、CNN/DailyMail、PubMed、SAMSum、WikiHow、XSum)上,以三种输出长度(50、100、150个token)评估了模型,使用了事实一致性、语义相似性、词汇重叠和类人质量等指标,同时考虑了效率因素。我们的研究结果揭示了显著的性能差异,特定模型在事实准确性(deepseek-v3)、类人质量(claude-3-5-sonnet)以及处理效率/成本效益(gemini-1.5-flash、gemini-2.0-flash)方面表现出色。性能因数据集而异,模型在技术领域表现挣扎,但在对话内容上表现良好。我们发现了事实一致性(在50个token时最佳)和感知质量(在150个token时最佳)之间的关键张力。我们的分析为不同用例提供了基于证据的建议,从需要事实准确性的高风险应用到需要高效处理的资源受限环境。这种综合方法通过将质量指标与操作考虑因素相结合,整合了准确性、效率和成本效益之间的权衡,以指导特定应用的模型选择。

关键词

引用

@article{arxiv.2504.04534,
  title  = {An Empirical Comparison of Text Summarization: A Multi-Dimensional Evaluation of Large Language Models},
  author = {Anantharaman Janakiraman and Behnaz Ghoraani},
  journal= {arXiv preprint arXiv:2504.04534},
  year   = {2025}
}