COFAR:图像检索中的常识与事实推理
计算机视觉与模式识别
2022-10-18 v1 计算与语言
摘要
使人类优于现代人工智能模型的一个特征是能够解释图像中视觉上不明显的内容。考虑以下两个自然语言检索查询——(i)“一排耐心等待买冰淇淋的顾客”和(ii)“一排前往参观印度著名莫卧儿建筑的游客”。解释这些查询需要人们进行(i)常识推理,例如将人解释为顾客或游客,将动作解释为等待购买或前往参观;以及(ii)与具名视觉实体相关的事实或世界知识,例如图像中的商店是否售卖冰淇淋,或图像中的地标是否是位于印度的莫卧儿建筑。此类推理超越了单纯的视觉识别。为了在图像检索中同时实现常识与事实推理,我们提出了一个统一框架,即知识检索增强多模态 Transformer(KRAMT),该框架将图像中的具名视觉实体视为通向百科知识的门户,并利用它们与自然语言查询来 grounding 相关知识。此外,KRAMT 无缝整合视觉内容与 grounded 知识,以学习图像与检索查询之间的对齐。该统一框架随后被用于执行需要常识与事实推理的图像检索。KRAMT 的检索性能在我们引入的新数据集(即 COFAR)上得到评估,并与相关方法进行比较。我们的代码与数据集发布于 https://vl2g.github.io/projects/cofar
引用
@article{arxiv.2210.08554,
title = {COFAR: Commonsense and Factual Reasoning in Image Search},
author = {Prajwal Gatti and Abhirama Subramanyam Penamakuri and Revant Teotia and Anand Mishra and Shubhashis Sengupta and Roshni Ramnani},
journal= {arXiv preprint arXiv:2210.08554},
year = {2022}
}
备注
Accepted in AACL-IJCNLP 2022