中文

从 CLIP 中提取自由稠密错位

计算机视觉与模式识别 2024-12-25 v1 机器学习

摘要

最近的视觉语言基础模型仍经常产生与输入不一致的输出,captioning 中的对象幻觉和text-to-image 生成模型中的提示错位均有所体现。近期研究探索了识别错位元素的方法,旨不仅提升可解释性,还能提高模型性能。然而,现有方法主要以零样本方式或依赖人工标注的微调模型,由于计算成本高昂,限制了可扩展性。本工作提出了一种新方法,称为 CLIP4DM,用于从预训练 CLIP 中检测稠密错位,特别关注图像和文本之间错位词语的定位。我们仔细改进了基于梯度的归因计算方法,使单个文本标记的负梯度指示错位。我们还提出了 F-CLIPScore,将错位归因与全局对齐分数聚合。我们在各种稠密错位检测基准上对方法进行评估,涵盖多种图像和文本领域以及不同类型的错位。我们的模型在零样本模型中实现了最先进的性能,并在保持卓越效率的同时与微调模型表现竞争。我们的定性示例显示,我们方法独特的优势在于检测实体级对象、不可视化对象和属性,这些对象在现有方法中难以检测。我们进行了消融研究和分析,凸显了该方法的优势与局限。我们的代码已公开发布于 https://github.com/naver-ai/CLIP4DM。

关键词

引用

@article{arxiv.2412.18404,
  title  = {Extract Free Dense Misalignment from CLIP},
  author = {JeongYeon Nam and Jinbae Im and Wonjae Kim and Taeho Kil},
  journal= {arXiv preprint arXiv:2412.18404},
  year   = {2024}
}

备注

16 pages, 14 figures, AAAI 2025