“讽刺、艺术,还是误导?”:面向意图感知的合成图像检测的多模态数据集
计算机视觉与模式识别
2025-09-10 v2 多媒体
摘要
多模态 AI 的近期进展推动了合成内容和超出语境内容的检测。然而,现有工作大体上忽视了 AI 生成图像背后的意图。为填补这一空白,我们引入了 S-HArM 数据集,用于意图感知的分类,包含 9,576 组来自 Twitter/X 和 Reddit 上的“野外”图像-文本对,标签为讽刺/讽刺、艺术或误导。此外,我们探索了三种提示策略(图像引导、描述引导和多模态引导),用于通过 Stable Diffusion 构建大规模合成训练数据集。我们进行了广泛的比较研究,包括模态融合、对比学习、重建网络、注意力机制和大型视觉语言模型。我们的结果表明,基于图像和多模态引导数据训练的模型对“野外”内容的泛化能力更好,这是由于保留了视觉上下文。然而,总体性能仍有限,凸显了推断意图的复杂性以及需要专门架构的必要性。
引用
@article{arxiv.2508.20670,
title = {"Humor, Art, or Misinformation?": A Multimodal Dataset for Intent-Aware Synthetic Image Detection},
author = {Anastasios Skoularikis and Stefanos-Iordanis Papadopoulos and Symeon Papadopoulos and Panagiotis C. Petrantonakis},
journal= {arXiv preprint arXiv:2508.20670},
year = {2025}
}