中文

TranX-Adapter:用于鲁棒 AI 生成图像检测的 MLLMs 中桥接人工物及语义的适配器

计算机视觉与模式识别 2026-02-26 v1

摘要

AI 生成图像(AIGI)技术的快速进步使得高度逼真的合成图像不断涌现,威胁公共信息的完整性与安全性。最近的研究表明,将纹理级人工物特征与语义特征一起纳入多模态大语言模型(MLLMs)可提高其 AIGI 检测能力。然而,我们的初步分析揭示,人工物特征呈现高度的特征内相似性,导致 softmax 操作后注意力图几乎均匀,从而引发注意力稀释,阻碍语义与人工物特征之间的有效融合。为此,我们提出一种轻量级融合适配器 TranX-Adapter,其集成了基于 Jensen-Shannon 散度计算人工物与语义预测概率之间的成本矩阵,以实现人工物信息向语义特征的传递,以及采用跨注意力实现语义信息向人工物特征的传递。实验表明,在多个先进 MLLMs 上进行的标准 AIGI 检测基准测试显示,TranX-Adapter 带来一致且显著的改进(最高提升约 6% 准确率)。

关键词

引用

@article{arxiv.2602.21716,
  title  = {TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection},
  author = {Wenbin Wang and Yuge Huang and Jianqing Xu and Yue Yu and Jiangtao Yan and Shouhong Ding and Pan Zhou and Yong Luo},
  journal= {arXiv preprint arXiv:2602.21716},
  year   = {2026}
}