基于关系导向多模态模型提示的开放视觉知识抽取
计算与语言
2023-10-31 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
图像包含丰富的关系知识,可帮助机器理解世界。现有的视觉知识抽取方法通常依赖于预定义的格式(如主-谓-宾元组)或词汇表(如关系类型),限制了所抽取知识的表达能力。在这项工作中,我们首次探索开放视觉知识抽取的新范式。为此,我们提出 OpenVik,其包含一个开放关系区域检测器,用于检测可能包含关系知识的区域,以及一个视觉知识生成器,通过以检测到的感兴趣区域提示大型多模态模型来生成无格式知识。我们还探索了两种数据增强技术,以使生成的无格式视觉知识多样化。广泛的知识质量评估凸显了 OpenVik 抽取的开视觉知识的正确性与独特性。此外,将我们抽取的知识整合到各种视觉推理应用中显示出一致的提升,表明 OpenVik 具有现实世界的适用性。
引用
@article{arxiv.2310.18804,
title = {Open Visual Knowledge Extraction via Relation-Oriented Multimodality Model Prompting},
author = {Hejie Cui and Xinyu Fang and Zihan Zhang and Ran Xu and Xuan Kan and Xin Liu and Yue Yu and Manling Li and Yangqiu Song and Carl Yang},
journal= {arXiv preprint arXiv:2310.18804},
year = {2023}
}
备注
Accepted to NeurIPS 2023