中文

利用人类编辑改进摘要生成

计算与语言 2025-01-07 v3 人工智能 机器学习

摘要

近期工作展示了以人类反馈范式学习的潜力,可生成由人类判定的高质量文本。现有工作利用人类反馈训练大语言模型(LLMs)用于通用领域抽象摘要,并获得了超越传统似然训练的摘要质量。本文中,我们关注一种较少被探索的人类反馈形式——人类编辑。我们提出序列对齐(非)似然训练(SALT),一种在训练循环中同时使用人类编辑数据与模型生成数据的新技术。此外,我们展示了利用现有训练数据中的真实摘要模拟人类编辑——模仿编辑,以及训练后获得的模型生成摘要,以减少对昂贵人类编辑数据的需求。在实验中,我们将人类反馈探索从通用领域摘要扩展至医学领域摘要。我们的结果证明了 SALT 在利用人类与模仿编辑提升摘要质量上的有效性。通过额外实验,我们表明当应用于人类编辑数据时,SALT 优于为人类偏好设计的常规 RLHF 方法——DPO。我们希望本文中的证据能促使研究者探索、收集并更好地可扩展地利用不同的人类反馈方法。

关键词

引用

@article{arxiv.2310.05857,
  title  = {Improving Summarization with Human Edits},
  author = {Zonghai Yao and Benjamin J Schloss and Sai P. Selvaraj},
  journal= {arXiv preprint arXiv:2310.05857},
  year   = {2025}
}

备注

Proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2023