中文

更新 CLIP 以优先考虑描述而非标题

计算机视觉与模式识别 2024-10-07 v2 人工智能 计算与语言

摘要

虽然 CLIPScore 是一种强大的通用指标,能够捕捉文本与图像之间的相似性,但它无法区分旨在补充图像信息的标题与旨在完全取代图像描述(例如用于无障碍)的描述。我们通过引入 Concadia 数据集来更新 CLIP 模型,使其为描述赋予更高的分数,而非标题,采用参数高效微调和源自因果可解释性工作的损失目标。该模型在保持迁移能力的同时,与盲人和低视力人群的判断相吻合,并具有可解释的结构,揭示了标题与描述之间的区别。

关键词

引用

@article{arxiv.2406.09458,
  title  = {Updating CLIP to Prefer Descriptions Over Captions},
  author = {Amir Zur and Elisa Kreiss and Karel D'Oosterlinck and Christopher Potts and Atticus Geiger},
  journal= {arXiv preprint arXiv:2406.09458},
  year   = {2024}
}