中文

利用时间对抗增强改进视频表征

计算机视觉与模式识别 2023-05-16 v2 人工智能

摘要

近期工作表明,若使用得当,对抗增强有益于神经网络(NNs)的泛化。本文提出时间对抗增强(TA),一种利用时间注意力的新颖视频增强技术。与常规对抗增强不同,TA 专为通过最大化时间相关损失函数以偏移神经网络针对视频片段的注意力分布而设计。我们证明 TA 可获得多样的时间视角,这对神经网络的关注点有显著影响。使用这些样本训练可弥补时间信息感知不平衡的缺陷,并增强抵御时间偏移的能力,最终带来更好的泛化。为利用 TA,我们提出时间视频对抗微调(TAF)框架以改进视频表征。TAF 是一种与模型无关、通用且利于可解释性的训练策略。我们在三个具挑战性的时间相关基准(Something-something V1&V2 与 diving48)上以四种强力模型(TSM、GST、TAM 和 TPN)评估 TAF。实验结果表明,TAF 在无明显增加参数或计算成本的情况下,以显著幅度提升了这些模型的测试准确率。作为副产品,TAF 还提升了分布外(OOD)设定下的鲁棒性。代码见 https://github.com/jinhaoduan/TAF。

关键词

引用

@article{arxiv.2304.14601,
  title  = {Improve Video Representation with Temporal Adversarial Augmentation},
  author = {Jinhao Duan and Quanfu Fan and Hao Cheng and Xiaoshuang Shi and Kaidi Xu},
  journal= {arXiv preprint arXiv:2304.14601},
  year   = {2023}
}

备注

To be appeared in IJCAI 2023