中文

针对对抗性行为操纵的鲁棒深度强化学习

机器学习 2026-02-18 v3 人工智能

摘要

本研究探讨了针对强化学习的行为定向攻击及其防御措施。行为定向攻击旨在通过状态观测中的对抗性干预,按照对手的意图操纵受害者的行为。现有行为定向攻击存在一些局限性,例如需要白盒访问受害者的策略。为解决此问题,我们提出了一种新的攻击方法,利用来自对抗性演示的模仿学习,该方法在对受害者策略访问受限的情况下有效,且与环境无关。此外,我们的理论分析证明,策略对状态变化的敏感性会影响防御性能,尤其是在轨迹的早期阶段。基于这一见解,我们提出了时间折扣正则化,该方法在保持任务性能的同时增强了对攻击的鲁棒性。据我们所知,这是首个专门针对行为定向攻击设计的防御策略。

关键词

引用

@article{arxiv.2406.03862,
  title  = {Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation},
  author = {Shojiro Yamabe and Kazuto Fukuchi and Jun Sakuma},
  journal= {arXiv preprint arXiv:2406.03862},
  year   = {2026}
}

备注

Accepted at ICLR 2026