行动消失:自我对弈强化学习中的对抗性行动删除
机器学习
2026-05-19 v1 人工智能
摘要
我们研究对抗性行动遮蔽在自我对弈强化学习中的问题:攻击者有选择性地删除受害者行动集合中的合法行动。不同于观察或行动扰动,删除是在智能体行动前消除决策选项。我们在牌类游戏中从 6 个到 5,531 个信息状态,以及两个非牌类领域进行实验,发现学习得到的遮蔽比随机遮蔽和学习扰动基线造成更大损害。该攻击在 Q-learning、PPO、NFSP、神经 NFSP 和 DQN 等受害者之间持久存在;跨智能体迁移;在自我对弈中放大;在扩展的遮蔽训练下也无法恢复。从机制上看,攻击者针对高价值决策点,这些点被到达加权条件行动容量(CAC)和价值加权细化 CAC 所捕获。这些结果指出,行动可用性是自我对弈强化学习中 distinct 的鲁棒性表面。
引用
@article{arxiv.2605.16312,
title = {When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning},
author = {Arahan Kujur},
journal= {arXiv preprint arXiv:2605.16312},
year = {2026}
}
备注
17 pages, 2 figures, 18 tables