中文

从大语言模型生成的反馈中学习摘要

计算与语言 2025-01-28 v2 人工智能

摘要

开发有效的文本摘要器仍然是一个挑战,原因在于大语言模型生成的摘要中存在幻觉、关键信息遗漏和冗长等问题。本工作探索使用大语言模型生成的反馈来改进摘要质量,通过使摘要与人类对忠实性、完整性和简洁性的偏好对齐。我们引入了 FeedSum,这是一个大规模数据集,包含跨不同领域的各种质量摘要的多维大语言模型反馈。我们的实验展示了反馈质量、维度和粒度如何影响偏好学习,揭示出高质量、多维、细粒度的反馈能显著改善摘要生成。我们还比较了使用此反馈的两种方法:监督微调和直接偏好优化。最后,我们介绍了 SummLlama3-8b,一个在生成人类偏好摘要方面优于近 10 倍大的 Llama3-70b-instruct 的模型,证明了较小的模型通过适当的训练也能达到优越的性能。完整的数据集和 SummLlama3-8B 模型可在 https://huggingface.co/datasets/DISLab/FeedSum 和 https://huggingface.co/DISLab/SummLlama3-8B 获取。

关键词

引用

@article{arxiv.2410.13116,
  title  = {Learning to Summarize from LLM-generated Feedback},
  author = {Hwanjun Song and Taewon Yun and Yuho Lee and Jihwan Oh and Gihun Lee and Jason Cai and Hang Su},
  journal= {arXiv preprint arXiv:2410.13116},
  year   = {2025}
}

备注

Accepted at NAACL 2025 (main, long)