中文

基于关系导向多模态模型提示的开放视觉知识抽取

计算与语言 2023-10-31 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

图像包含丰富的关系知识,可帮助机器理解世界。现有的视觉知识抽取方法通常依赖于预定义的格式(如主-谓-宾元组)或词汇表(如关系类型),限制了所抽取知识的表达能力。在这项工作中,我们首次探索开放视觉知识抽取的新范式。为此,我们提出 OpenVik,其包含一个开放关系区域检测器,用于检测可能包含关系知识的区域,以及一个视觉知识生成器,通过以检测到的感兴趣区域提示大型多模态模型来生成无格式知识。我们还探索了两种数据增强技术,以使生成的无格式视觉知识多样化。广泛的知识质量评估凸显了 OpenVik 抽取的开视觉知识的正确性与独特性。此外,将我们抽取的知识整合到各种视觉推理应用中显示出一致的提升,表明 OpenVik 具有现实世界的适用性。

关键词

引用

@article{arxiv.2310.18804,
  title  = {Open Visual Knowledge Extraction via Relation-Oriented Multimodality Model Prompting},
  author = {Hejie Cui and Xinyu Fang and Zihan Zhang and Ran Xu and Xuan Kan and Xin Liu and Yue Yu and Manling Li and Yangqiu Song and Carl Yang},
  journal= {arXiv preprint arXiv:2310.18804},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023