中文

面向 Deepfake 检测的 Vision Transformer 及时综述

计算机视觉与模式识别 2024-05-15 v1

摘要

近年来,deepfake 技术的快速发展彻底改变了内容创作,降低了伪造成本并提升了质量。然而,这一进步带来了紧迫的隐患,如对个人权利的侵犯、国家安全威胁以及公共安全风险。为应对这些挑战,各种检测方法相继涌现,其中基于 Vision Transformer (ViT) 的方法在通用性和效率上展现出卓越性能。本综述及时概述了基于 ViT 的 deepfake 检测模型,将其分为独立式、顺序式和并行式架构。此外,简明地描述了每种模型的结构与特点。通过分析现有研究并探讨未来方向,本综述旨在使研究人员深入理解 ViT 在 deepfake 检测中的关键作用,为该领域的学术与实践提供有价值的参考。

关键词

引用

@article{arxiv.2405.08463,
  title  = {A Timely Survey on Vision Transformer for Deepfake Detection},
  author = {Zhikan Wang and Zhongyao Cheng and Jiajie Xiong and Xun Xu and Tianrui Li and Bharadwaj Veeravalli and Xulei Yang},
  journal= {arXiv preprint arXiv:2405.08463},
  year   = {2024}
}