衡量 RLHF 中代码完成的记忆现象
机器学习
2024-10-28 v2 计算与语言
软件工程
摘要
强化学习与人类反馈(RLHF)已成为对齐大型模型以符合用户偏好的最主流方法。与微调不同,后者已有许多研究关注训练数据记忆;然而,RLHF 对记忆的影响或引入机制尚不明确。理解这一关系至关重要,因为实际用户数据可能被收集并用于对齐大型模型;如果用户数据在 RLHF 期间被记忆并随后被重现,这可能引发隐私问题。除了 RLHF,其他方法如直接偏好优化(DPO)和 PO 也因直接从人类偏好中学习,无需通过强化学习优化中间奖励模型而受到欢迎。本文我们分析了训练数据记忆如何在 RLHF 和直接偏好学习的每个阶段显现并传播。我们聚焦于代码完成模型,因为代码完成是大型语言模型最流行的用例之一。我们发现 RLHF 显著降低了用于奖励建模和强化学习的数据被记忆的可能性,相较于直接在该数据上进行微调;但已在 RLHF 微调阶段记忆的示例,在大多数情况下仍会在 RLHF 之后保持记忆状态。相反,我们发现通过 PO 的一种特殊情况——身份偏好优化(IPO)——直接从人类偏好数据进行对齐,会增加训练数据被重现的可能性,相较于 RLHF。我们的工作表明,与直接偏好学习相比,RLHF 是一种更安全的方式,可减轻在对齐大型语言模型时重现敏感偏好数据的风险。我们发现我们的结论在多个代码完成数据集、任务和模型规模下均具有稳健性。
引用
@article{arxiv.2406.11715,
title = {Measuring memorization in RLHF for code completion},
author = {Aneesh Pappu and Billy Porter and Ilia Shumailov and Jamie Hayes},
journal= {arXiv preprint arXiv:2406.11715},
year = {2024}
}