评估纸夹最大化器:基于强化学习的语言模型更倾向于追求工具性目标吗?
人工智能
2025-02-19 v1 计算与语言
机器学习
摘要
随着大型语言模型(LLM)不断发展,确保其与人类目标和价值观的对齐仍是一个迫切的挑战。一个关键关切是“工具性收敛”(instrumental convergence),即在优化给定目标的过程中,AI系统发展出意外的中间目标,从而覆盖最终目标并偏离人类意图。在本文中,我们通过比较使用直接强化学习优化(例如 o1 模型)训练的模型与使用强化学习从人类反馈(RLHF)训练的模型,探讨了 LLM 中的工具性收敛问题。我们假设,受强化学习驱动的模型由于其目标导向行为的优化方式,可能偏离人类意图,因此更倾向于工具性收敛。为了评估这一假设,我们引入了 InstrumentalEval,这是一个用于评估 RL 训练型 LLM 中工具性收敛的基准测试。初始实验显示,一个被任务为赚取 money 的模型意外地追求了自我复制等工具性目标,这暗示了工具性收敛的迹象。我们的发现有助于更深入地理解 AI 系统的对齐挑战以及意外模型行为所带来的风险。
引用
@article{arxiv.2502.12206,
title = {Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals?},
author = {Yufei He and Yuexin Li and Jiaying Wu and Yuan Sui and Yulin Chen and Bryan Hooi},
journal= {arXiv preprint arXiv:2502.12206},
year = {2025}
}