中文

VisKnow:用于对象理解的视觉知识库构建

计算机视觉与模式识别 2025-12-10 v1

摘要

对象理解是计算机视觉中的基础任务。除了提供类别标签作为典型输出的对象识别之外,深入的对象理解代表了对对象类别的全面感知,涉及其组成部分、外观特征、跨类别关系、上下文背景知识等。实现此能力需要充足的多模态数据,包括针对特定任务的视觉注释(如部件、属性和共现关系),以及支持推理和问答等高层次任务的文本知识。然而,这些数据通常是任务导向的,且系统化组织得不够,难以实现对对象类别的预期理解。为此,我们提出了视觉知识库(Visual Knowledge Base),将多模态对象知识结构化为图形形式,并呈现一个名为 VisKnow 的构建框架,用于从视觉和文本来源提取对象级别的多模态知识。该框架通过专家设计和大规模模型应用的结合,整合了来自对象和部件级别区域注释的增强对齐文本和图像来源知识。作为具体案例研究,我们构建了 AnimalKB,一个覆盖406个动物类别的结构化动物知识库,包含从百科学文档中提取的22K条文本知识三元组、420K张图片以及对应的区域注释。一系列实验表明,AnimalKB显著增强了对象级别的视觉任务(如零样本识别和细粒度VQA),并作为知识图谱完成和部件分割的挑战性基准。我们的发现凸显了自动构建视觉知识库以推动视觉理解及其实际应用潜力的可能性。项目页面可访问于 https://vipl-vsu.github.io/VisKnow。

关键词

引用

@article{arxiv.2512.08221,
  title  = {VisKnow: Constructing Visual Knowledge Base for Object Understanding},
  author = {Ziwei Yao and Qiyang Wan and Ruiping Wang and Xilin Chen},
  journal= {arXiv preprint arXiv:2512.08221},
  year   = {2025}
}

备注

16 pages, 12 figures, 7 tables. Under review