中文

在基于 LLM 的智能体中实现替代目标以实现更安全的协商

人工智能 2026-04-07 v1

摘要

替代目标已被提出作为降低协商失败风险的策略。替代目标是委托人可以赋予 AI 智能体的目标,用于将针对智能体的任何威胁转移开,使其不触及委托人真正关心的内容。例如,可以使其智能体关心防止资金被烧毁。然后在协商交互中,其他智能体可以威胁烧毁其资金,而非威胁花钱伤害委托人。重要的是,智能体对防止资金被烧毁的关心程度必须与其对花钱伤害委托人的关心程度相等。在本文中,我们在基于语言模型的智能体中实现了替代目标。具体而言,我们试图让基于语言模型的智能体以与对正常威胁相同的方式回应烧毁资金的威胁。我们提出了四种不同方法,使用提示、微调和脚手架技术。我们对四种方法进行了实验评估。我们发现基于脚手架和微调的方法优于简单提示。特别是,微调和脚手架更精确地实现了针对替代目标威胁的期望行为。我们还在其他情境中的能力和倾向的副作用方面比较了不同方法。我们发现基于脚手架的方法表现最佳。

关键词

引用

@article{arxiv.2604.04341,
  title  = {Implementing surrogate goals for safer bargaining in LLM-based agents},
  author = {Caspar Oesterheld and Maxime Riché and Filip Sondej and Jesse Clifton and Vincent Conitzer},
  journal= {arXiv preprint arXiv:2604.04341},
  year   = {2026}
}