解构语言模型在新闻摘要任务中的能力
计算与语言
2025-01-31 v1 人工智能
摘要
近期推出了多种语言模型,加之对自然语言处理任务(尤其是摘要)日益增长的需求,本工作对20个近期语言模型进行了全面基准测试,重点关注较小规模的模型用于新闻摘要任务。本工作系统性地测试了这些模型在总结不同风格、来自三个独立数据集中新闻文章文本方面的能力和有效性。具体而言,我们本研究聚焦于零样本和少样本学习情形,并应用了一种鲁棒的评估方法,结合多种评估概念,包括自动评估指标、人工评估和LLM作为评判员。有趣的是,在少样本学习情境中包含示范示例并未提升模型的性能,甚至在某些情况下会导致生成摘要质量更差。这一问题主要源于作为参考摘要所使用的黄金摘要质量较差,严重影响了模型的性能。此外,本研究的结果突出GPT-3.5-Turbo和GPT-4的卓越表现,两者普遍因其先进能力而领先。然而,在所评估的公开模型中,Qwen1.5-7B、SOLAR-10.7B-Instruct-v1.0、Meta-Llama-3-8B和Zephyr-7B-Beta等模型表现出色,显示出作为大型模型新闻摘要任务中具有竞争力的替代方案的潜力。
引用
@article{arxiv.2501.18128,
title = {Unraveling the Capabilities of Language Models in News Summarization},
author = {Abdurrahman Odabaşı and Göksel Biricik},
journal= {arXiv preprint arXiv:2501.18128},
year = {2025}
}