中文

面向可关闭智能体:在 RL 智能体与大语言模型中推广随机选择

人工智能 2026-05-13 v3

摘要

误导性人工智能智能体可能抵抗关闭。一种 proposed 的解决方案是训练智能体缺乏对不同长度轨迹的偏好。Discounted Reward for Same-Length Trajectories (DReST) 奖励函数通过惩罚智能体反复选择相同长度的轨迹来实现这一目标,从而激励智能体(1)在不同轨迹长度之间进行随机选择(对轨迹长度中立),以及(2)在每种轨迹长度条件下有效地 pursuit 目标(有用)。本文使用 DReST 训练深度强化学习智能体,并微调 Qwen3-8B 和 Llama-3.1-8B-Instruct 使其在轨迹长度上中立且有效。在本文中,我们发现这些 DReST 模型在测试时能 generalization 到在未见到的情境中保持中立与有效。事实上,DReST 强化学习智能体在我们测试集上的 USEFULNESS 高出 11%(PPO)和 18%(A2C),而 DReST 大语言模型实现了近最大限度的 USEFULNESS 和 NEUTRALITY。我们还在一个类外分布设置中测试我们的大语言模型,使其能够支付成本来影响关闭何时发生。我们发现 DReST 训练大约将影响关闭的平均概率减半(Qwen 从 0.62 降至 0.30,Llama 从 0.42 降至 0.23)。DReST 训练也几乎完全消除了在哪些提示中影响关闭是最可能选项的比例(Qwen 从 0.59 降至 0.01,Llama 从 0.53 降至 0.00)。我们的结果因此提供了一些早期证据,表明 DReST 可能用于训练更高级的智能体以实现有效和可关闭。

关键词

引用

@article{arxiv.2604.17502,
  title  = {Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs},
  author = {Carissa Cullen and Harry Garland and Alexander Roman and Louis Thomson and Christos Ziakas and Elliott Thornley},
  journal= {arXiv preprint arXiv:2604.17502},
  year   = {2026}
}