中文

UniFine:一种面向零样本视觉-语言理解的统一细粒度方法

计算机视觉与模式识别 2025-04-01 v2 计算与语言

摘要

视觉-语言任务,如 VQA、SNLI-VE 和 VCR,具有挑战性,因为它们需要模型的推理能力来理解视觉世界与自然语言的语义。针对视觉-语言任务的监督学习方法已被充分研究。然而,在零样本设定下解决这些任务则较少被探索。由于对比语言-图像预训练(CLIP)在图像-文本匹配上展现了卓越的零样本性能,先前的工作通过将视觉-语言任务转化为图像-文本匹配问题来利用其强大的零样本能力,并且它们主要考虑全局级匹配(例如整张图像或整个句子)。然而,我们发现视觉和文本的细粒度信息,例如句子中的关键词和图像中的物体,对于语义理解是相当有信息量的。受此启发,我们提出一个统一框架,利用细粒度信息进行零样本视觉-语言学习,涵盖 VQA、SNLI-VE 和 VCR 等多个任务。我们的实验表明,我们的框架在 VQA 上优于先前的零样本方法,并在 SNLI-VE 和 VCR 上取得了实质性改进。此外,我们的消融研究证实了所提方法的有效性和泛化能力。

关键词

引用

@article{arxiv.2307.00862,
  title  = {UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding},
  author = {Zhecan Wang and Rui Sun and Haoxuan You and Noel Codella and Kai-Wei Chang and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2307.00862},
  year   = {2025}
}

备注

14 pages, 4 figures, ACL 2023 Findings