中文

NAU-QMUL:利用 BERT 和 CLIP 进行多模态 AI 生成图像检测

计算机视觉与模式识别 2026-03-02 v1 计算与语言

摘要

本文旨在检测 AI 生成的图像并识别其具体生成模型负责其生成,我们提出了一个多模态多任务模型。该模型利用预训练的 BERT 和 CLIP 视觉编码器分别进行文本和图像特征提取,并采用量身定制的多任务损失函数进行跨模态特征融合。此外,还利用基于伪标签的数据增强策略扩充了训练数据集。该模型在"CT2:AI 生成图像检测"比赛的任务 A 和任务 B 中均取得第五名,分别实现了 83.16% 和 48.88% 的 F1 分数。这些发现突显了所提架构的有效性以及其在实际场景中检测 AI 生成内容的潜力。本方法的源代码已发布于 https://github.com/xxxxxxxxy/AIGeneratedImageDetection。

关键词

引用

@article{arxiv.2602.23863,
  title  = {NAU-QMUL: Utilizing BERT and CLIP for Multi-modal AI-Generated Image Detection},
  author = {Xiaoyu Guo and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2602.23863},
  year   = {2026}
}