通过合成任务和强化学习教导大语言模型保持上下文忠实性
计算与语言
2025-11-13 v3 人工智能
摘要
教导大型语言模型 (LLM) 在提供上下文中保持忠实性对于构建可靠的信息寻求系统至关重要。因此,我们提出了一套系统性的框架 CANOE,用于在无需人工标注的情况下降低 LLM 的忠实性幻觉。具体而言,我们首先合成了包含四种多样化任务的短格式问答 (QA) 数据,以构建高质量且易于验证的训练数据,无需人工标注。我们还提出了 Dual-GRPO 方法,这是一种基于规则的强化学习方法,包含从合成短格式 QA 数据中派生的三个量身定制的基于规则奖励,同时优化短格式和长格式响应的生成。值得注意的是,Dual-GRPO 无需手动标记偏好数据来训练奖励模型,也避免了仅依赖合成短格式 QA 数据时对短格式生成过度优化。实验结果表明,CANOE 在 11 种不同任务上显著提升了 LLM 的忠实性,甚至超过了最先进的 LLM,如 GPT-4o 和 OpenAI o1。
引用
@article{arxiv.2505.16483,
title = {Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning},
author = {Shuzheng Si and Haozhe Zhao and Cheng Gao and Yuzhuo Bai and Zhitong Wang and Bofei Gao and Kangyang Luo and Wenhao Li and Yufei Huang and Gang Chen and Fanchao Qi and Minjia Zhang and Baobao Chang and Maosong Sun},
journal= {arXiv preprint arXiv:2505.16483},
year = {2025}
}
备注
AAAI 2026 (Oral Presentation)