利用成对数据上下文的局部监督新颖物体图像描述
计算机视觉与模式识别
2021-11-22 v2 计算与语言
摘要
在本文中,我们提出一种方法,用于改进对训练数据集中无描述标签的新颖物体的图像描述方案。我们将该方法称为局部监督新颖物体描述(PS-NOC)。PS-NOC 与模型架构无关,主要关注训练方法,即利用现有的完全配对图像-描述数据以及仅带有新颖物体检测标签的图像(部分配对数据)。我们通过利用现有图像-描述对的上下文,为新颖物体创建合成配对描述数据。随后,我们为带有新颖物体的部分配对图像生成伪标签描述,并使用这些额外数据微调描述模型。我们还在 PS-NOC 中提出了 SCST 的一种变体,称为 SCST-F1,可直接优化新颖物体的 F1 分数。以流行的描述模型(Up-Down)为基线,PS-NOC 在留出的 MS COCO 域外测试集上取得了新的 SOTA 结果,即 85.9 F1 分数和 103.8 CIDEr。与训练时未使用部分配对数据的基线模型相比,分别提高了 85.9 和 34.1 分。我们还进行了详细的消融研究以证明我们方法的有效性。
引用
@article{arxiv.2109.05115,
title = {Partially-Supervised Novel Object Captioning Leveraging Context from Paired Data},
author = {Shashank Bujimalla and Mahesh Subedar and Omesh Tickoo},
journal= {arXiv preprint arXiv:2109.05115},
year = {2021}
}