OSIC:一种新提出的一阶段图像描述生成器
计算机视觉与模式识别
2022-11-07 v1
摘要
主流图像描述模型通常为两阶段描述器,即由预训练检测器计算目标特征,并将其输入语言模型以生成文本描述。然而,此类操作会引起基于任务的信息鸿沟从而降低性能,因为检测任务中的目标特征为次优表示,无法为后续文本生成提供所有必要信息。此外,目标特征通常由最后一层特征表示,丢失了输入图像的局部细节。本文中,我们提出一种具有动态多视角学习的新型一阶段图像描述生成器(OSIC),其在一阶段内直接将输入图像转换为描述性句子。由此,基于任务的信息鸿沟可大幅减小。为获取丰富特征,我们使用 Swin Transformer 计算多级特征,随后将其输入一种新型动态多视角嵌入模块以利用输入图像的全局结构与局部纹理。为增强编码器在描述任务中的全局建模,我们提出一种新的双维精炼模块以非局部地建模嵌入特征的交互。最终,OSIC 可获取丰富且有用的信息以改进图像描述任务。在基准 MS-COCO 数据集上的大量对比验证了本方法的优越性能。
引用
@article{arxiv.2211.02321,
title = {OSIC: A New One-Stage Image Captioner Coined},
author = {Bo Wang and Zhao Zhang and Mingbo Zhao and Xiaojie Jin and Mingliang Xu and Meng Wang},
journal= {arXiv preprint arXiv:2211.02321},
year = {2022}
}