中文

SNEAK:面向自然语言视频定位的同义句感知对抗攻击

计算机视觉与模式识别 2021-12-09 v1 人工智能 计算与语言

摘要

自然语言视频定位(NLVL)是视觉-语言理解领域的一项重要任务,它不仅要求对计算机视觉和自然语言单方面有深入理解,更重要的是对两者之间的相互作用有深入理解。对抗脆弱性已被广泛认为是深度神经网络模型的一个关键安全问题,需要谨慎研究。尽管在视频和语言任务中已有广泛但相互独立的研究,但目前对视觉-语言联合任务(如NLVL)中对抗鲁棒性的理解尚不充分。因此,本文旨在从攻击和防御两方面考察脆弱性的三个层面,全面研究NLVL模型的对抗鲁棒性。为实现攻击目标,我们提出了一种新的对抗攻击范式,称为面向NLVL的同义句感知对抗攻击(SNEAK),该范式捕获了视觉与语言之间的跨模态相互作用。

关键词

引用

@article{arxiv.2112.04154,
  title  = {SNEAK: Synonymous Sentences-Aware Adversarial Attack on Natural Language Video Localization},
  author = {Wenbo Gou and Wen Shi and Jian Lou and Lijie Huang and Pan Zhou and Ruixuan Li},
  journal= {arXiv preprint arXiv:2112.04154},
  year   = {2021}
}