中文

合作强化学习中功率正则化的优势

机器学习 2024-06-18 v1 人工智能 计算机科学与博弈论 多智能体系统

摘要

仅以优化任务奖励为目标训练的协作式多智能体强化学习算法,可能导致权力集中,使得系统中单个智能体的故障或恶意意图可能摧毁每个智能体的奖励。在人类团队背景下,明确考虑权力如何分配以确保没有人成为单点故障通常是有益的。在此,我们认为,在协作式强化学习系统中明确正则化权力集中度,可以产生对单智能体故障、对抗攻击以及合作者激励变化更具鲁棒性的系统。为此,我们定义了一种实用的成对权力度量,用于衡量任何合作者影响自我智能体奖励的能力,然后提出一个平衡任务奖励与权力集中度的权力正则化目标。基于这一新目标,我们证明始终存在一个均衡,其中每个智能体都在执行平衡权力与任务奖励的权力正则化最佳响应。此外,我们提出了两种用于训练智能体实现该权力正则化目标的算法:基于样本的权力正则化,其在训练期间注入对抗性数据;以及通过内在动机进行权力正则化,其向训练目标添加调节权力的内在动机。我们的实验表明,这两种算法都成功地平衡了任务奖励和权力,导致比仅任务奖励基线更低的权力行为,并在系统中某个智能体偏离策略时避免灾难性事件。

关键词

引用

@article{arxiv.2406.11240,
  title  = {The Benefits of Power Regularization in Cooperative Reinforcement Learning},
  author = {Michelle Li and Michael Dennis},
  journal= {arXiv preprint arXiv:2406.11240},
  year   = {2024}
}