中文

基于相关性改写评估 LLMs 在零样本抽象摘要生成中的表现

计算与语言 2025-02-04 v2

摘要

大型语言模型(LLMs)已在零样本生成给定文章的抽象摘要方面取得了最先进的性能。然而,关于这种零样本摘要过程鲁棒性的了解仍很少。为填补这一差距,我们提出了相关性改写(relevance paraphrasing)这一简单策略,用于衡量 LLMs 作为摘要生成器的鲁棒性。相关性改写方法识别贡献生成理想摘要的最相关句子,然后对这些句子进行改写,以获得 minimally 扰动的数据集。通过在原始数据集和扰动数据集上评估模型的摘要性能,可以评估 LLM 的一种鲁棒性方面。我们在 4 个多样化数据集上进行了广泛的相关性改写实验,以及 4 个不同规模的 LLMs(GPT-3.5-Turbo、Llama-2-13B、Mistral-7B 和 Dolly-v2-7B)。我们的结果表明,LLMs 对 minimally 扰动后的文章并非一致的摘要生成器,这进一步需要改进。

关键词

引用

@article{arxiv.2406.03993,
  title  = {Assessing LLMs for Zero-shot Abstractive Summarization Through the Lens of Relevance Paraphrasing},
  author = {Hadi Askari and Anshuman Chhabra and Muhao Chen and Prasant Mohapatra},
  journal= {arXiv preprint arXiv:2406.03993},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Findings