基于检测驱动的可见与未见物体类别场景描述生成
计算机视觉与模式识别
2022-07-04 v2
摘要
图像描述生成是视觉与语言领域交叉中最具挑战性的问题之一。在本工作中,我们提出了一种现实的描述生成任务,其中输入场景可能包含没有对应视觉或文本训练样本的视觉物体。针对该问题,我们提出了一种基于检测的方法,由一个单阶段广义零样本检测模型组成,用于识别并定位可见与未见类别的实例,以及一个基于模板的描述模型,将检测结果转换为句子。为改进为描述提供关键信息的广义零样本检测模型,我们根据类间语义相似度定义了有效的类表示,并利用其特殊结构构建了一种有效的未见/可见类别置信度分数校准机制。我们还提出了一种新颖的评估指标,通过分别度量生成句子的视觉与非视觉内容,为描述输出提供额外洞察。我们的实验凸显了在所提出的零样本设定下研究描述生成的重要性,并验证了所提基于检测的零样本描述方法的有效性。
引用
@article{arxiv.2108.06165,
title = {Caption Generation on Scenes with Seen and Unseen Object Categories},
author = {Berkan Demirel and Ramazan Gokberk Cinbis},
journal= {arXiv preprint arXiv:2108.06165},
year = {2022}
}
备注
Accepted for Publication at Image and Vision Computing (IMAVIS)