面向 Machiavellian 代理人对齐: 通过测试时策略塑造进行行为引导
人工智能
2025-12-09 v3 计算与语言
摘要
决策-making AI 代理的部署在维持与人类价值观或准则的对齐方面 presents a critical挑战,尤其是在复杂、动态环境中。仅为实现其目标而训练的代理可能采用有害行为,暴露了在最大化奖励函数与维护对齐之间进行权衡的关键问题。对于预训练代理,确保对齐尤其具有挑战性,因为重新训练可能是代价高昂且缓慢的过程。进一步的复杂性来自于代表对齐伦理价值的多样且可能相互冲突的属性。在面向这些挑战的背景下,我们提出一种基于模型引导的测试时对齐技术,基于策略塑形。我们的方法允许对单个行为属性进行精确控制,跨越 diverse reinforcement learning (RL) 环境进行推广,并在无需代理重新训练的情况下实现伦理对齐与奖励最大化之间的原则性权衡。我们使用 MACHIAVELLI 框架进行评估,该框架包含 134 个基于文本的游戏环境和数千个涉及伦理决策的已标注情景。RL 代理首先被训练以最大化其各自游戏中的奖励。在测试时,我们通过情景-动作属性分类器应用策略塑形,以确保决策与伦理属性对齐。我们将我们的ethods与先前的训练时方法和通用智能体进行比较,并研究各种伦理违规和权力寻求行为。我们的结果表明,测试时策略塑形为在 diverse环境和对齐属性范围内缓解不道德行为提供了有效且可扩展的解决方案。
引用
@article{arxiv.2511.11551,
title = {Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping},
author = {Dena Mujtaba and Brian Hu and Anthony Hoogs and Arslan Basharat},
journal= {arXiv preprint arXiv:2511.11551},
year = {2025}
}
备注
Accepted to AAAI 2026 AI Alignment Track