面向综合合成媒体检测:局限性、挑战与多模态解决方案之路
计算机视觉与模式识别
2025-11-17 v1 神经与进化计算
摘要
人工智能(AI)在媒体领域的应用在过去十年里取得了快速发展。生成对抗网络(GANs)的出现提升了照片级图像生成的质量。随后,扩散模型带来了新的生成媒体时代。这些进步使得区分真实与合成内容变得困难。深度伪造(deepfakes)的兴起展示了这些工具如何被用于传播虚假信息、政治阴谋论、侵犯隐私和欺诈。为此,已develop许多检测模型。它们常常使用深度学习方法,如卷积神经网络(CNNs)和视觉转换器(ViTs)。这些模型寻找视觉、空间或时间异常。然而,这些方法往往难以在未见数据上泛化,难以处理来自不同模型的内容。此外,现有方法在多模态数据和高度修改的内容方面效果不佳。本研究审阅了二十四项关于AI生成媒体检测的最新研究。对每项研究进行个体审查,以识别其贡献和弱点。随后,审阅总结了当前方法所面临的常见局限性和关键挑战。基于此分析,提出了一种研究方向,重点关注多模态深度学习模型。此类模型有望提供更稳健、更通用的检测能力。它为未来的研究者提供了一个清晰的起点,以构建更强大的防御措施,以抵御有害的合成媒体。
引用
@article{arxiv.2511.11116,
title = {Toward Generalized Detection of Synthetic Media: Limitations, Challenges, and the Path to Multimodal Solutions},
author = {Redwan Hussain and Mizanur Rahman and Prithwiraj Bhattacharjee},
journal= {arXiv preprint arXiv:2511.11116},
year = {2025}
}
备注
10 Pages, 4 figures, 1 table, 7th International Conference on Trends in Computational and Cognitive Engineering(TCCE-2025)