解开幻象:理解人类对音视频深度伪造的感知
计算机视觉与模式识别
2024-11-12 v2 人工智能
计算机与社会
机器学习
多媒体
摘要
当代深度伪造的出现引起了广泛关注,因为人工智能(AI)生成的合成媒体增加了误解的风险,难以与真实内容区分。目前,机器学习技术已被广泛用于自动检测深度伪造。然而,人类感知的研究相对不足。恶意的深度伪造最终可能导致公共和社会问题。我们人类能否正确地辨别我们观看视频的真实性?答案显然不确定;因此,本文旨在通过主观研究评估人类辨别深度伪造视频的能力。我们通过将人类观察者与五种最先进的音视频深度伪造检测模型进行比较来呈现我们的发现。为此,我们采用游戏化概念,为 110 名参与者(55 名母语者和 55 名非母语者)提供一个基于网页的平台,让他们可以访问一系列 40 条视频(20 条真实视频和 20 条假视频)以确定其真实性。每个参与者以不同的随机顺序两次完成相同的 40 条视频实验。这些视频从 FakeAVCeleb 数据集中手动选取。我们发现所有 AI 模型在同一 40 条视频上的表现均优于人类。该研究还显示,尽管欺骗并非不可能,但人类倾向于高估自己的检测能力。我们的实验结果可能有助于制定人类与机器性能基准,推动 Forensics 分析,并实现自适应防御措施。
引用
@article{arxiv.2405.04097,
title = {Unmasking Illusions: Understanding Human Perception of Audiovisual Deepfakes},
author = {Ammarah Hashmi and Sahibzada Adil Shahzad and Chia-Wen Lin and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:2405.04097},
year = {2024}
}