中文

基于大型语言模型的元素感知摘要:专家对齐评测与思维链方法

计算与语言 2023-05-24 v1

摘要

自动摘要生成包含源文档关键思想的简明摘要。作为新闻子领域最主流的数据集,CNN/DailyMail 和 BBC XSum 已被广泛用于性能基准测试。然而,这些数据集的参考摘要存在噪声,主要体现在事实幻觉和信息冗余方面。为应对该挑战,我们首先依据 Lasswell (1948) 提出的“Lasswell 传播模型”标注了新的专家撰写元素感知测试集,使参考摘要能客观且全面地聚焦于更细粒度的新闻元素。利用新测试集,我们观察到 LLMs 令人惊讶的零样本摘要能力,这解决了先前工作中 LLMs 零样本摘要的人类偏好与自动评测指标间结果不一致的问题。进一步,我们提出摘要思维链(SumCoT)技术以引导 LLMs 逐步生成摘要,帮助其将源文档更多细粒度细节整合进符合人类写作思维的最终摘要。实验结果表明,我们的方法在两个数据集上分别以 ROUGE-L 指标超越最先进微调 PLMs 和零样本 LLMs 达 +4.33/+4.77。数据集与代码公开于 https://github.com/Alsace08/SumCoT。

关键词

引用

@article{arxiv.2305.13412,
  title  = {Element-aware Summarization with Large Language Models: Expert-aligned Evaluation and Chain-of-Thought Method},
  author = {Yiming Wang and Zhuosheng Zhang and Rui Wang},
  journal= {arXiv preprint arXiv:2305.13412},
  year   = {2023}
}

备注

Accepted by ACL 2023