中文

TRAP:面向世界模型规划的尾部感知排名攻击

机器学习 2026-05-05 v1 人工智能

摘要

世界模型通过内部生成和评估想象轨迹实现长程规划,成为通用智能体的有前景的基础。然而,这种以想象驱动的决策过程也引入了新的安全风险。现有后门攻击通常旨在操控局部特征、单步预测或即时策略输出。虽然这些目标对较弱的反应式模型可能足够,但对世界模型常常无效,因为学习到的动态先验和规划过程可能吸收或消除浅层扰动的影响。更重要的是,我们发现世界模型 exhibits 一种根植于想象轨迹长尾排名结构的独特后门漏洞,即破坏数个关键决策轨迹的排序可系统性地劫持规划过程。为利用此漏洞,我们提出 TRAP,一种针对世界模型的后门攻击框架,目标为想象轨迹排名。TRAP 结合尾部感知排名损失聚焦决策关键轨迹,采用双门控机制稳定优化并调节何时何处应用攻击惩罚。在触发条件下,TRAP 改变想象轨迹的相对排序以重定向规划结果,同时在干净输入上维持正常的排名结构。在 DreamerV3 和 TD-MPC2 上的 diverse 任务实验表明,TRAP 持续引发行为偏离和显著性能下降,凸显了针对基于世界模型智能体的专门安全评估的必要性。

关键词

引用

@article{arxiv.2605.01950,
  title  = {TRAP: Tail-aware Ranking Attack for World-Model Planning},
  author = {Siyuan Duan and Ke Zhang and Xizhao Luo},
  journal= {arXiv preprint arXiv:2605.01950},
  year   = {2026}
}