中文

CLIP4IDC:面向图像差异描述的CLIP方法

计算机视觉与模式识别 2022-10-19 v2

摘要

图像差异描述(IDC)旨在生成句子以描述两张外观相似图像之间的差异。常规方法使用预训练且通常冻结的视觉特征提取器来学习IDC模型。由此可能产生两个主要问题:(1) 用于训练此类视觉编码器的预训练数据集与下游IDC任务的数据集之间通常存在较大领域鸿沟;(2) 视觉特征提取器在分别编码两幅图像时,往往不能有效地编码两图之间的视觉变化。鉴于新近提出的CLIP出色的零样本性能,我们提出CLIP4IDC,将CLIP模型迁移至IDC任务以解决上述问题。与直接微调CLIP生成句子不同,我们引入自适应训练过程,使CLIP的视觉编码器基于文本描述捕获并对齐图像对中的差异。在CLEVR-Change、Spot-the-Diff与Image-Editing-Request三个IDC基准数据集上的实验证明了CLIP4IDC的有效性。

关键词

引用

@article{arxiv.2206.00629,
  title  = {CLIP4IDC: CLIP for Image Difference Captioning},
  author = {Zixin Guo and Tzu-Jui Julius Wang and Jorma Laaksonen},
  journal= {arXiv preprint arXiv:2206.00629},
  year   = {2022}
}

备注

Accepted to AACL-IJCNLP 2022