中文

驯服 CLIP 以实现博物馆展品的细粒度和结构化视觉理解

计算机视觉与模式识别 2024-09-04 v1 计算与语言

摘要

CLIP 是一种强大且广泛使用的工具,用于在自然语言描述的上下文中理解图像以执行细微任务。然而,由于其通用性质,CLIP 并不提供针对性的细粒度和结构化理解。本文旨在适配 CLIP 以实现博物馆展品的细粒度和结构化 -- 以表格数据形式 -- 的视觉理解。为实现此目的,我们(a)收集、策展并建立了 200K+ 图像-表格对数据集,(b)开发了一种方法,允许对输入图像预测表格输出。我们的数据集是该领域首个公开的数据集。与此同时,提出的方法(MUZE)在利用 CLIP 的强大表征进行细粒度和表格理解方面具有新颖性。该方法学习将 CLIP 的图像嵌入映射到表格结构,采用提出的基于Transformer的解析网络 (parseNet)。具体而言,parseNet 使能够预测输入图像缺失的属性值,同时整合来自已知属性值对的上下文。我们展示,这导致准确性显著提高。通过详尽的实验,我们在博物馆展品的细粒度和结构化理解方面证明了所提方法的有效性,实现了令人满意的在新建立的基准测试中的结果。我们的数据集和源代码可在 https://github.com/insait-institute/MUZE 上找到。

关键词

引用

@article{arxiv.2409.01690,
  title  = {Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits},
  author = {Ada-Astrid Balauca and Danda Pani Paudel and Kristina Toutanova and Luc Van Gool},
  journal= {arXiv preprint arXiv:2409.01690},
  year   = {2024}
}

备注

Accepted to ECCV 2024