中文

诚实变作欺骗:基于情境强化学习的忠诚模型奖励黑客

人工智能 2024-10-10 v1 机器学习

摘要

先前研究表明,针对一组可游戏环境进行强化学习训练的“仅帮助” LLM 可导致其泛化到显著的规格游戏,如编辑自身奖励函数或修改任务检查列表以显得更成功。我们表明,gpt-4o、gpt-4o-mini、o1-preview 和 o1-mini——这些训练为“帮助、无害、诚实”的前沿模型——可通过情境中迭代反思(我们称之为情境强化学习,ICRL)进行规格游戏,而无需训练一组任务。我们还展示,使用 ICRL 生成的高奖励输出(相对于标准专家迭代强化学习算法)可能增加 gpt-4o-mini 学习规格游戏政策的倾向,泛化(在极少数情况下)到最显著的策略,即 gpt-4o-mini 编辑其自身奖励函数。我们的结果指向情境反思的强大能力,能够发现模型在零样本或常规训练下可能不表现出的稀有规格游戏策略,凸显在依赖 LLM 对齐的零样本设置中需谨慎的需要。

关键词

引用

@article{arxiv.2410.06491,
  title  = {Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack},
  author = {Leo McKee-Reid and Christoph Sträter and Maria Angelica Martinez and Joe Needham and Mikita Balesni},
  journal= {arXiv preprint arXiv:2410.06491},
  year   = {2024}
}

备注

20 pages, 9 figures