中文

QR-CLIP:引入显式开放世界知识用于地点与时间推理

计算机视觉与模式识别 2023-06-29 v3 人工智能

摘要

日常图像可能传达抽象含义,需要我们从中记忆并推断深层信息。为鼓励此类类人推理,在本工作中,我们教机器预测图像拍摄的地点和时间,而非执行传统的分割或分类等基础任务。受Horn的QR理论启发,我们设计了一种新颖的QR-CLIP模型,包含两个组件:1) 数量模块首先回溯更多开放世界知识作为候选语言输入;2) 相关性模块仔细估计视觉与语言线索并推断地点和时间。实验显示了我们QR-CLIP的有效性,在地点和时间推理任务上分别以约10%和130%的相对提升优于先前的SOTA。本研究为地点和时间推理奠定了技术基础,并表明有效引入开放世界知识是此类任务的良方之一。

关键词

引用

@article{arxiv.2302.00952,
  title  = {QR-CLIP: Introducing Explicit Open-World Knowledge for Location and Time Reasoning},
  author = {Weimin Shi and Mingchen Zhuge and Dehong Gao and Zhong Zhou and Ming-Ming Cheng and Deng-Ping Fan},
  journal= {arXiv preprint arXiv:2302.00952},
  year   = {2023}
}

备注

Technical Report. Github: https://github.com/Shi-Wm/QR-CLIP