超越眼见为实:论音视频 Deepfake 的众包检测
信息检索
2026-05-07 v1 人工智能
摘要
Deepfake 日益逼真且易于制作,引发了人们对错误信息环境下人类判断可靠性的担忧。我们通过测量众包工人区分真实视频与篡改视频的一致性,以及当他们将视频标记为被篡改时,识别篡改类型(仅音频、仅视频或音视频)的准确性和报告篡改时间戳的一致性,来研究音视频 Deepfake 检测。我们在 Prolific 上使用 AV-Deepfake1M 和 Trusted Media Challenge (TMC) 数据集进行了两项匹配的众包研究。我们从每个数据集中抽取 48 个视频(共 96 个),并收集了 960 份判断(每个视频 10 份)。结果表明,众包工人很少将真实视频误判为篡改视频,但他们遗漏了许多篡改,且跨视频的一致性仍然有限。对每个视频聚合多份判断可稳定真实性信号,但无法恢复大多数工人始终遗漏的篡改。即使工人检测到了篡改,篡改类型的识别也比真实性检测嘈杂得多,其中音视频联合的情况尤其难以识别。总体而言,这些发现表明众包可以为音视频真实性提供可扩展的筛查信号,而可靠的模态归因仍是一个开放挑战。
关键词
引用
@article{arxiv.2605.04797,
title = {Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes},
author = {Michael Soprano and Andrea Cioci and Stefano Mizzaro},
journal= {arXiv preprint arXiv:2605.04797},
year = {2026}
}
备注
Accepted at ROMCIR 2026, the 6th Workshop on Reducing Online Misinformation through Credible Information Retrieval, held in conjunction with ECIR 2026