中文

策略掩码:基于值的强化学习智能体中护栏的一种方法

人工智能 2025-01-22 v2 机器学习 多智能体系统

摘要

使用奖励函数来构建AI学习和决策是当前强化学习范式的核心;然而,如果没有精心设计奖励函数,智能体可能以被视为“不良”或“不道德”的方式学习解决问题。如果没有透彻理解奖励函数产生的激励,就很难对其行为施加有原则且通用的控制机制。在本文中,我们研究了为使用奖励函数学习决策的AI智能体构建护栏的方法。我们提出了一种新颖的方法,称为策略掩码,用于显式学习然后抑制不良的AI智能体行为。我们将该方法应用于研究AI智能体中的说谎行为,并表明它可以有效地通过抑制训练后的说谎行为来修改智能体行为,同时不损害智能体有效执行任务的能力。

关键词

引用

@article{arxiv.2501.05501,
  title  = {Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents},
  author = {Jonathan Keane and Sam Keyser and Jeremy Kedziora},
  journal= {arXiv preprint arXiv:2501.05501},
  year   = {2025}
}