ChatGPT 在音视频深度伪造检测中的能力:ChatGPT、AI 模型与人类感知的比较研究
计算机视觉与模式识别
2024-11-15 v1 人工智能
人机交互
机器学习
多媒体
摘要
涉及音视频操作的多模态深度伪造日益成为一种威胁,因为它们难以用肉眼或使用基于单模态深度学习的伪造检测方法来发现。音视频取证模型虽然比单模态模型能力更强,但需要大量训练数据,并且在训练和推理方面计算成本高昂。此外,这些模型缺乏可解释性,且通常难以泛化到未见过的操作。在这项研究中,我们考察了大型语言模型(LLM)(即 ChatGPT)的检测能力,以识别并解释音视频深度伪造内容中任何可能的视觉和听觉伪影及操作。我们在基准多模态深度伪造数据集的视频上进行了大量实验,以评估 ChatGPT 的检测性能,并将其与最先进的多模态取证模型和人类的检测能力进行比较。实验结果表明,领域知识和提示工程对于使用 LLM 进行视频伪造检测任务的重要性。与基于端到端学习的方法不同,ChatGPT 能够解释模态内或跨模态可能存在的空间和时空伪影及不一致性。此外,我们还讨论了 ChatGPT 在多媒体取证任务中的局限性。
引用
@article{arxiv.2411.09266,
title = {How Good is ChatGPT at Audiovisual Deepfake Detection: A Comparative Study of ChatGPT, AI Models and Human Perception},
author = {Sahibzada Adil Shahzad and Ammarah Hashmi and Yan-Tsung Peng and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:2411.09266},
year = {2024}
}