更新 CLIP 以优先考虑描述而非标题
计算机视觉与模式识别
2024-10-07 v2 人工智能
计算与语言
摘要
虽然 CLIPScore 是一种强大的通用指标,能够捕捉文本与图像之间的相似性,但它无法区分旨在补充图像信息的标题与旨在完全取代图像描述(例如用于无障碍)的描述。我们通过引入 Concadia 数据集来更新 CLIP 模型,使其为描述赋予更高的分数,而非标题,采用参数高效微调和源自因果可解释性工作的损失目标。该模型在保持迁移能力的同时,与盲人和低视力人群的判断相吻合,并具有可解释的结构,揭示了标题与描述之间的区别。
关键词
引用
@article{arxiv.2406.09458,
title = {Updating CLIP to Prefer Descriptions Over Captions},
author = {Amir Zur and Elisa Kreiss and Karel D'Oosterlinck and Christopher Potts and Atticus Geiger},
journal= {arXiv preprint arXiv:2406.09458},
year = {2024}
}