通过多模态密集知识图谱传播识别未见物体
计算机视觉与模式识别
2023-12-12 v2 人工智能
摘要
零样本学习(ZSL)旨在自动识别未见物体,是一种使机器持续理解新现实世界知识的有前景的学习范式。近来,知识图谱(KG)已被证明是处理大规模非属性数据零样本任务的有效方案。先前研究总是将未见与已见物体的关系从现有知识图谱嵌入到视觉信息中,以提升对未见数据的认知能力。实际上,现实世界知识天然由多模态事实构成。相较于图视角下的普通结构知识,多模态KG能为认知系统提供细粒度知识。例如,文本描述和视觉内容比仅依赖知识三元组能刻画事实更关键的细节。遗憾的是,由于不同模态间特征对齐的瓶颈,该多模态细粒度知识大多未被利用。为此,我们提出了一种多模态密集ZSL框架,通过设计的密集注意力模块和自校准损失将图像区域与相应语义嵌入进行匹配。这使得我们ZSL框架的语义迁移过程学习到实体间更具区分性的知识。我们的模型也摆脱了仅使用粗糙全局特征的性能局限。我们进行了大量实验并在大规模真实世界数据上评估了模型。实验结果清晰证明了所提模型在标准零样本分类任务中的有效性。
引用
@article{arxiv.2306.08487,
title = {Recognizing Unseen Objects via Multimodal Intensive Knowledge Graph Propagation},
author = {Likang Wu and Zhi Li and Hongke Zhao and Zhefeng Wang and Qi Liu and Baoxing Huai and Nicholas Jing Yuan and Enhong Chen},
journal= {arXiv preprint arXiv:2306.08487},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:1805.11724 by other authors