基于相关性改写评估 LLMs 在零样本抽象摘要生成中的表现
计算与语言
2025-02-04 v2
摘要
大型语言模型(LLMs)已在零样本生成给定文章的抽象摘要方面取得了最先进的性能。然而,关于这种零样本摘要过程鲁棒性的了解仍很少。为填补这一差距,我们提出了相关性改写(relevance paraphrasing)这一简单策略,用于衡量 LLMs 作为摘要生成器的鲁棒性。相关性改写方法识别贡献生成理想摘要的最相关句子,然后对这些句子进行改写,以获得 minimally 扰动的数据集。通过在原始数据集和扰动数据集上评估模型的摘要性能,可以评估 LLM 的一种鲁棒性方面。我们在 4 个多样化数据集上进行了广泛的相关性改写实验,以及 4 个不同规模的 LLMs(GPT-3.5-Turbo、Llama-2-13B、Mistral-7B 和 Dolly-v2-7B)。我们的结果表明,LLMs 对 minimally 扰动后的文章并非一致的摘要生成器,这进一步需要改进。
引用
@article{arxiv.2406.03993,
title = {Assessing LLMs for Zero-shot Abstractive Summarization Through the Lens of Relevance Paraphrasing},
author = {Hadi Askari and Anshuman Chhabra and Muhao Chen and Prasant Mohapatra},
journal= {arXiv preprint arXiv:2406.03993},
year = {2025}
}
备注
Accepted to NAACL 2025 Findings