基于强化学习的检索增强型大语言模型可信对齐
计算与语言
2024-10-23 v1
摘要
可信度是大语言模型在实际应用中的 essential 前提。本文聚焦于检索增强型语言模型的可信度问题。尽管借助外部证据支持,检索增强生成仍因上下文与参数知识之间的冲突而出现幻觉。我们认为检索增强型语言模型具备供应基于上下文与参数知识双方响应的内在能力。灵感来源于将语言模型与人类偏好对齐,我们首次步入检索增强型语言模型的对齐领域,使其仅依赖外部证据作出响应,忽略参数知识的干扰。具体而言,我们提出了基于强化学习的 Trustworthy-Alignment 算法,理论上和实验上展示了大语言模型在无需显式监督响应方式的情况下达到可信状态的能力。本工作凸显了大语言模型通过自身探索内在能力的潜力,并将对齐应用场景从满足人类偏好拓展到构建可信 agent。
引用
@article{arxiv.2410.16843,
title = {Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning},
author = {Zongmeng Zhang and Yufeng Shi and Jinhua Zhu and Wengang Zhou and Xiang Qi and Peng Zhang and Houqiang Li},
journal= {arXiv preprint arXiv:2410.16843},
year = {2024}
}
备注
ICML 2024