NOC-REK:基于外部知识检索词汇的新物体描述
计算机视觉与模式识别
2022-03-29 v1
摘要
新物体描述旨在刻画训练数据中缺失的物体,其关键在于为模型提供物体词汇。尽管现有方法严重依赖物体检测模型,我们将检测步骤视为以 Wiktionary 中任意物体定义嵌入形式从外部知识进行的词汇检索,其中检索使用从 transformers 模型学习的图像区域特征。我们提出一种端到端的基于外部知识检索词汇的新物体描述方法(NOC-REK),其同时学习词汇检索与描述生成,成功描述训练数据集之外的新物体。此外,我们的模型通过在新物体出现时仅更新外部知识,消除了模型重训练的需 求。我们在留出集 COCO 与 Nocaps 数据集上的综合实验表明,NOC-REK 相比 SOTA 方法效果显著。
引用
@article{arxiv.2203.14499,
title = {NOC-REK: Novel Object Captioning with Retrieved Vocabulary from External Knowledge},
author = {Duc Minh Vo and Hong Chen and Akihiro Sugimoto and Hideki Nakayama},
journal= {arXiv preprint arXiv:2203.14499},
year = {2022}
}
备注
Accepted at CVPR 2022