中文

知识增强的小样本视觉关系检测

计算机视觉与模式识别 2023-03-10 v1 人工智能

摘要

视觉关系检测(VRD)旨在检测物体间关系以理解图像。多数现有 VRD 方法依赖每种关系数千训练样本以达到满意性能。一些近期论文通过精心设计的流水线与预训练词向量的小样本学习来解决该问题。然而,现有小样本 VRD 模型的性能受限于糟糕的泛化能力,因为它们难以处理视觉关系巨大的语义多样性。尽管如此,人类凭其知识能用极少样例学习新关系。受此启发,我们设计了一个知识增强的小样本 VRD 框架,利用文本知识与视觉关系知识来提升小样本 VRD 的泛化能力。文本知识与视觉关系知识分别取自预训练语言模型与自动构建的视觉关系知识图。我们广泛验证了框架的有效性。在常用 Visual Genome 数据集上三个基准进行的实验表明,我们的性能以大幅优势超越现有最先进模型。

关键词

引用

@article{arxiv.2303.05342,
  title  = {Knowledge-augmented Few-shot Visual Relation Detection},
  author = {Tianyu Yu and Yangning Li and Jiaoyan Chen and Yinghui Li and Hai-Tao Zheng and Xi Chen and Qingbin Liu and Wenqiang Liu and Dongxiao Huang and Bei Wu and Yexin Wang},
  journal= {arXiv preprint arXiv:2303.05342},
  year   = {2023}
}

备注

work in progress