中文

通过感知运动实现对抗鲁棒的视频感知

计算机视觉与模式识别 2022-12-16 v1

摘要

尽管性能优异,最先进的计算机视觉模型在遭遇对抗样本时往往失效。视频感知模型在攻击下往往更脆弱,因为 adversary 可在高维数据中操纵更多位置。本文中,我们发现视频模型脆弱性的一个原因是其在对抗扰动下无法感知正确运动。受大量表明运动是人类视觉系统关键因素的证据启发,我们提出通过恢复感知到的运动信息来纠正模型所见。由于运动信息是视频数据的内在结构,恢复运动信号可在推理时完成而无需任何人工标注,这使模型能适应未预见的最坏情况输入。在 UCF-101 与 HMDB-51 数据集上的可视化与实证实验表明,在深度视觉模型中恢复运动信息可提升对抗鲁棒性。即使在 adversary 知晓我们防御的自适应攻击下,我们的算法依然有效。我们的工作通过利用数据中的内在结构,为鲁棒视频感知算法提供了新见解。我们的网页位于 https://motion4robust.cs.columbia.edu。

关键词

引用

@article{arxiv.2212.07815,
  title  = {Adversarially Robust Video Perception by Seeing Motion},
  author = {Lingyu Zhang and Chengzhi Mao and Junfeng Yang and Carl Vondrick},
  journal= {arXiv preprint arXiv:2212.07815},
  year   = {2022}
}