WMAttack:面向世界模型智能体的对抗评估的自动化攻击搜索
机器学习
2026-05-25 v1
摘要
尽管世界模型正日益广泛用作决策代理,但由于缺乏专门的自动化评估方法,其对抗鲁棒性仍未得到充分探索。一个关键障碍在于,攻击评估必须同时准确且高效:弱且手动调谐的攻击会高估鲁棒性,而穷举超参数搜索则不可行,因为每个候选方案都需要通过学习到的潜在动态进行闭环 rollout。我们引入WMAttack,一个用于世界模型智能体对抗评估的自动化攻击搜索框架。WMAttack 将鲁棒性评估形式化为对攻击配置(包括攻击族、扰动预算、优化步数、重启次数及分配规则)在有限预算下的搜索。为提升搜索准确性,自纠正攻击搜索(SCAS)通过奖励退化、动作不稳定性、运行成本和 rollout 变异性等反馈来细化攻击提议分布。为提升搜索效率,基于表示引导的攻击检索(RGAR)从表示相似任务中检索有效的历史配置,为不可见环境提供温暖启动。我们提供理论解释,表明在概率质量转向高效用攻击时,提议细化可改善有限预算下的搜索。 在Atari 和 DeepMind Control 任务上,WMAttack 一致发现更强的攻击,使 DreamerV3 Atari 上归一化奖励下降从 0.497 提升至 1.034,DMC 上从 0.319 提升至 0.682。消融实验进一步表明,RGAR 改善了初始候选质量,SCAS 在固定评估预算下提升最终攻击效用。
引用
@article{arxiv.2605.23220,
title = {WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents},
author = {Zhixiang Guo and Siyuan Liang and Shi Fu and Cheng Guo and Andras Balogh and Mark Jelasity and Dacheng Tao},
journal= {arXiv preprint arXiv:2605.23220},
year = {2026}
}