Omni-IML:面向统一图像操纵定位的通用模型
计算机视觉与模式识别
2025-04-30 v2 密码学与安全
机器学习
摘要
现有的图像操纵定位(IML)方法大多依赖任务特定的设计,仅在目标IML任务上表现良好,而在多个IML任务上联合训练会导致显著的性能下降,阻碍了实际应用。为此,我们提出Omni-IML,这是第一个旨在统一跨多任务IML的通用模型。具体而言,Omni-IML通过三个关键组件实现泛化:(1)Modal Gate Encoder,自适应选择每个样本的最优编码模态;(2)Dynamic Weight Decoder,动态调整解码器的滤波器以适应具体任务;(3)异常增强模块利用边界框监督突出被篡改区域,从而促进任务无关特征的学习。除定位功能外,为支持被篡改图像的解释,我们构建了Omni-273k大型高质量数据集,包含被篡改artifact的自然语言描述。数据集通过我们自动的链式思维标注技术完成标注。我们还设计了一个简洁而有效的解释模块以更好地利用这些描述性标注。我们的大量实验表明,单一的Omni-IML模型在所有四个主要IML任务上均实现了最先进的性能,为实际部署提供了可靠方案,也为通用模型在图像取证领域的发展指明了前景。我们的代码和数据集将公开提供。
引用
@article{arxiv.2411.14823,
title = {Omni-IML: Towards Unified Image Manipulation Localization},
author = {Chenfan Qu and Yiwu Zhong and Fengjun Guo and Lianwen Jin},
journal= {arXiv preprint arXiv:2411.14823},
year = {2025}
}