UKnow:一种用于推理与视觉-语言预训练的多模态知识图谱数据集统一知识协议
计算机视觉与模式识别
2024-10-01 v4
摘要
本工作提出一种称为 UKnow 的统一知识协议,从数据角度促进基于知识的研究。特别针对视觉与语言模态,我们将数据知识划分为五类单元类型,即图像内、文本内、跨图像、跨文本以及图像-文本,并搭建高效流水线以帮助从任意数据集中构建多模态知识图谱。得益于知识图谱天然包含的逻辑信息,与常用的图像-文本对相比,以 UKnow 格式组织数据集开启了更多的数据使用可能。遵循 UKnow 协议,我们从国际公共新闻中收集了一个大规模多模态知识图谱数据集,包含 1,388,568 个节点(其中 571,791 个为视觉相关)与 3,673,817 条三元组。该数据集还标注了丰富的事件标签,包括 11 个粗粒度标签与 9,185 个细粒度标签。在 4 个基准上的实验展示了 UKnow 在支持常识推理和以单一数据集助推视觉-语言预训练方面的潜力,这得益于其统一的知识组织形式。见附录下载数据集。
引用
@article{arxiv.2302.06891,
title = {UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training},
author = {Biao Gong and Shuai Tan and Yutong Feng and Xiaoying Xie and Yuyuan Li and Chaochao Chen and Kecheng Zheng and Yujun Shen and Deli Zhao},
journal= {arXiv preprint arXiv:2302.06891},
year = {2024}
}