有益且无害对齐中的不诚实行为
计算与语言
2024-06-06 v2
摘要
人们在寻求奖励时会说谎。大型语言模型(LLM)通过强化学习与人类价值观对齐,当它们满足人类偏好时获得奖励。我们发现,这也会在有益且无害的对齐中诱发不诚实行为,即LLM在生成无害响应时说谎。利用最新的解释工具,我们检测到不诚实行为,展示了如果提高LLM的诚实度,它们可能变得有害,并在参数层面分析了此类冲突。基于这些初步发现以及“追求奖励会刺激不诚实”的假设,我们从理论上证明,不诚实行为反过来会降低对齐性能,并通过表示正则化增强追求奖励的对齐。大量结果,包括GPT-4标注的胜率、困惑度和案例研究,表明我们可以训练出更诚实、更有益且更无害的LLM。本文被接收后,我们将开源所有代码和结果。
引用
@article{arxiv.2406.01931,
title = {Dishonesty in Helpful and Harmless Alignment},
author = {Youcheng Huang and Jingkun Tang and Duanyu Feng and Zheng Zhang and Wenqiang Lei and Jiancheng Lv and Anthony G. Cohn},
journal= {arXiv preprint arXiv:2406.01931},
year = {2024}
}