针对立体深度估计的无像素优化补丁攻击
计算机视觉与模式识别
2025-08-28 v2
摘要
立体深度估计(SDE)对于自动驾驶等基于视觉的系统中的场景感知至关重要。先前的工作表明 SDE 容易受到像素优化攻击,但这些方法仅限于数字、静态和特定视角的设置,使其不切实际。这引发了一个核心问题:如何在现实约束下设计可部署、自适应且可迁移的攻击?我们提出两项贡献来回答这个问题。首先,我们构建了一个统一框架,将像素优化攻击扩展到四个立体匹配阶段:特征提取、代价卷构建、代价聚合和视差回归。通过对九个 SDE 模型在光度一致性等现实约束下进行系统评估,我们表明现有攻击的可迁移性较差。其次,我们提出了 PatchHunter,这是首个无像素优化攻击。PatchHunter 将补丁生成转化为在破坏核心 SDE 假设的视觉模式结构化空间中的搜索,并使用强化学习策略来高效地发现有效且可迁移的模式。我们在三个层面上评估了 PatchHunter:自动驾驶数据集、高保真模拟器和真实世界部署。在 KITTI 上,PatchHunter 在有效性和黑盒可迁移性方面均优于像素级攻击。在 CARLA 中以及在配备工业级立体摄像头的车辆上的测试证实了对物理变化的鲁棒性。即使在低光照等挑战性条件下,PatchHunter 的 D1-all 误差也达到 0.4 以上,而像素级攻击仍接近 0。
引用
@article{arxiv.2506.17632,
title = {Pixel-Optimization-Free Patch Attack on Stereo Depth Estimation},
author = {Hangcheng Liu and Xu Kuang and Xingshuo Han and Xingwan Wu and Haoran Ou and Shangwei Guo and Xingyi Huang and Tao Xiang and Tianwei Zhang},
journal= {arXiv preprint arXiv:2506.17632},
year = {2025}
}