中文

以 BLIP2IDC 和合成数据增强重新阐释图像差异描述任务

计算机视觉与模式识别 2025-10-15 v2 人工智能

摘要

过去几年生成模型质量的提升,使得能够在重要规模上生成编辑变体图像。为抵消此类技术的有害影响,图像差异描述(IDC)任务旨在描述两幅图像之间的差异。虽然该任务在简单3D渲染图像上取得成功,但在真实世界图像上仍感到困难。原因有两个:训练数据的稀缺,以及难以捕捉复杂图像之间的细粒差异。为此,本文提出一种简单而有效的框架,既适配现有图像描述模型以适应IDC任务,又增强IDC数据集。我们引入BLIP2IDC,将BLIP2适配至IDC任务,计算成本低,且在真实世界IDC数据集上显著优于双流方法。我们还提出使用合成数据增强以无偏方式提高IDC模型性能。我们表明,合成数据增强策略提供高质�数据,导致构建了一个适合IDC任务的新挑战数据集,命名为Syned1。

关键词

引用

@article{arxiv.2412.15939,
  title  = {Reframing Image Difference Captioning with BLIP2IDC and Synthetic Augmentation},
  author = {Gautier Evennou and Antoine Chaffin and Vivien Chappelier and Ewa Kijak},
  journal= {arXiv preprint arXiv:2412.15939},
  year   = {2025}
}

备注

This paper has been accepted for the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2025; Code released at https://github.com/gautierevn/BLIP2IDC