针对指涉多目标跟踪系统的语言-视觉关联对抗攻击
计算机视觉与模式识别
2026-03-31 v3 密码学与安全
摘要
语言-视觉理解已驱动高级感知系统的发展,尤其是指涉式多目标跟踪 (RMOT) 这一新兴范式。通过利用自然语言查询,RMOT 系统可对满足给定语义描述的对象进行选择性跟踪,通过基于 Transformer 的时空推理模块实现。端到端 (E2E) RMOT 模型进一步在 Transformer 主干网络中统一特征提取、时序记忆和空间推理,实现对融合文本-视觉表示的长程时空建模。尽管取得了这些进展,RMOT 的可靠性和鲁棒性仍未得到充分探讨。本文从设计逻辑角度审视 RMOT 系统的安全性,识别了破坏语言-视觉指涉和轨迹-对象匹配组件的对抗性漏洞。此外,我们发现采用基于 FIFO 记忆的高级 RMOT 模型存在新漏洞,其中的针对性且持续的对其时空推理的攻击会在多个后续帧中在历史缓冲区中引入持续性错误。我们提出了 VEIL,一种新的对抗框架,旨在干扰 RMOT 模型的统一指涉-匹配机制。我们表明,精心设计的数字和物理扰动可损坏跟踪逻辑可靠性,导致轨迹 ID 切换和终止。我们使用 Refer-KITTI 数据集进行全面评估,以验证 VEIL 的有效性,并证明迫切需要针对关键大规模应用的安全感知 RMOT 设计。
引用
@article{arxiv.2509.02028,
title = {See No Evil: Adversarial Attacks Against Linguistic-Visual Association in Referring Multi-Object Tracking Systems},
author = {Halima Bouzidi and Haoyu Liu and Mohammad Abdullah Al Faruque},
journal= {arXiv preprint arXiv:2509.02028},
year = {2026}
}
备注
Accepted to the NeurIPS 2025 Workshop on Reliable ML from Unreliable Data