看到、听到、并知晓:深度伪造视频检测中的多模态策略
多媒体
2026-02-03 v1 计算机视觉与模式识别
人机交互
摘要
随着深度伪造视频日益难以被人类识别,理解人类使用的检测策略对于设计有效的媒体素养干预措施至关重要。我们对195名年龄在21至40岁之间的参与者进行了研究,他们判断真实视频与深度伪造视频,评估了自身的置信度,并报告了他们在视觉、音频和知识策略中所依赖的线索。参与者在真实视频上表现得更准确,而对深度伪造视频的判断则较低,且对真实内容的预期校准误差更小。通过关联规则挖掘,我们识别出影响表现的线索组合。视觉外观、声音特征和直觉常常共现,以实现成功的识别,这突显了在人类检测中采用多模态方法的重要性。我们的发现显示哪些线索有助于或阻碍检测,并为设计引导有效线索使用的媒体素养工具提供了方向。建立在这些见解之上的干预措施可以帮助人们提高识别技能,更抵抗欺骗性数字媒体。
引用
@article{arxiv.2602.01284,
title = {Seeing, Hearing, and Knowing Together: Multimodal Strategies in Deepfake Videos Detection},
author = {Chen Chen and Dion Hoe-Lian Goh},
journal= {arXiv preprint arXiv:2602.01284},
year = {2026}
}