OmniDiff:面向细粒度图像差异描述的综合性基准
计算机视觉与模式识别
2026-02-12 v2
摘要
图像差异描述 (IDC) 旨在生成图像对之间细微差异的自然语言描述,这既需要精确的视觉变化定位,又需要连贯的语义表达。尽管近期取得了进展,但现有数据集往往缺乏广度和深度,限制了其在复杂和动态环境中的适用性:(1) 从广度角度来看,当前数据集局限于特定场景中物体的有限变化;(2) 从深度角度来看,以往的基准通常提供过于简化的描述。为了应对这些挑战,我们引入了 OmniDiff,这是一个综合性数据集,包含 324 种多样化的场景——涵盖真实世界的复杂环境和 3D 合成设置——具有平均长度为 60 个词的细粒度人工注释,并覆盖 12 种不同的变化类型。在此基础之上,我们提出了 MDiff,这是一个通过即插即用的多尺度差分感知 (MDP) 模块增强的多模态大型语言模型。该模块提高了模型准确识别和描述图像间差异的能力,同时保持了基础模型的泛化能力。借助 OmniDiff 数据集,MDiff 在多个基准测试中取得了 SOTA 性能,包括 Spot-the-Diff、IEdit、CLEVR-Change、CLEVR-DC 和 OmniDiff,与现有方法相比,在跨场景差异识别准确率上展现出显著提升。数据集、代码和模型将公开发布,以支持进一步的研究。
引用
@article{arxiv.2503.11093,
title = {OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning},
author = {Yuan Liu and Saihui Hou and Saijie Hou and Jiabao Du and Shibei Meng and Yongzhen Huang},
journal= {arXiv preprint arXiv:2503.11093},
year = {2026}
}