RAT:面向目标行为的深度强化学习智能体对抗攻击
机器学习
2024-12-17 v1 人工智能
密码学与安全
机器人学
摘要
评估深度强化学习(DRL)智能体针对目标行为攻击的鲁棒性至关重要。这些攻击旨在操纵受害者表现出与攻击者目标一致的具体行为,通常绕过传统的基于奖励的防御。先前的方法主要关注降低累积奖励;然而,奖励通常过于笼统,无法有效捕捉复杂的安全需求。因此,仅关注奖励降低可能导致次优的攻击策略,特别是在需要更精确行为操纵的安全关键场景中。为应对这些挑战,我们提出了 RAT,一种用于通用目标行为攻击的方法。RAT 训练一个与人类偏好明确对齐的意图策略,作为对抗者的精确行为目标。同时,对抗者操纵受害者的策略以遵循这一目标行为。为增强这些攻击的有效性,RAT 动态调整回放缓冲区中的状态占用率,从而实现更可控和有效的行为操纵。我们在机器人仿真任务上的实证结果表明,RAT 在诱导特定行为方面优于现有的对抗攻击算法。此外,RAT 在提高智能体鲁棒性方面展现出潜力,从而产生更具恢复力的策略。我们进一步通过引导 Decision Transformer 智能体在各种 MuJoCo 任务中采用与人类偏好一致的行为来验证 RAT 的有效性,展示了其在多样化任务中的适用性。
引用
@article{arxiv.2412.10713,
title = {RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors},
author = {Fengshuo Bai and Runze Liu and Yali Du and Ying Wen and Yaodong Yang},
journal= {arXiv preprint arXiv:2412.10713},
year = {2024}
}
备注
Accepted by AAAI 2025