中文

基于图像级弱监督视觉概念识别的无配对图像描述

计算机视觉与模式识别 2022-03-08 v1 计算与语言

摘要

无配对图像描述(UIC)的目标是在训练阶段不使用图像-描述对的情况下描述图像。尽管具有挑战性,我们期望该任务可通过利用与视觉概念对齐的图像训练集来完成。由于用于训练的边界框(BBox)标签或关系三元组标签获取成本高昂,大多数现有研究使用现成算法来获取视觉概念。为解决标注昂贵的问题,我们提出一种实现高性价比 UIC 的新方法。具体而言,我们以弱监督方式采用图像级标签来优化 UIC 模型。对于每张图像,我们假设仅可获得图像级标签,而不包含具体位置和数量。这些图像级标签用于训练弱监督目标识别模型以提取图像中的目标信息(如实例),提取的实例用于基于增强图神经网络(GNN)推断不同目标间的关系。所提方法取得了与先前方法相当甚至更优的性能,且无需昂贵的标注成本。此外,我们设计了一种未识别目标(UnO)损失,结合视觉概念奖励,以改进推断的目标与关系信息同图像的对齐。它能有效缓解现有 UIC 模型生成含不存在目标的句子的问题。据我们所知,这是首次尝试仅基于图像级标签解决 UIC 的弱监督视觉概念识别(WS-UIC)问题。我们进行了大量实验,证明所提 WS-UIC 模型在 COCO 数据集上取得了令人鼓舞的结果,同时显著降低了标注成本。

关键词

引用

@article{arxiv.2203.03195,
  title  = {Unpaired Image Captioning by Image-level Weakly-Supervised Visual Concept Recognition},
  author = {Peipei Zhu and Xiao Wang and Yong Luo and Zhenglong Sun and Wei-Shi Zheng and Yaowei Wang and Changwen Chen},
  journal= {arXiv preprint arXiv:2203.03195},
  year   = {2022}
}

备注

13 pages, 11 figures, 6 tables