面向图像描述学习的差异化代表性风格建模
计算机视觉与模式识别
2023-08-16 v2
摘要
多年来,最先进(SoTA)的图像描述方法在一些评价指标(如CIDEr)上取得了可喜的结果。然而,近期研究发现,这些方法生成的描述往往偏向于仅捕捉训练语料库中最为通用的模式(即语言模式)的“平均”描述,即所谓的模式坍塌问题。受其影响,生成的描述多样性有限,且通常不如人类所做的自然图像描述信息丰富。本文中,我们旨在通过提出一种用于图像描述的离散模式学习(DML)范式来避免该问题。我们的创新思路是探索训练描述语料库中的丰富模式,学习一组“模式嵌入”,并进一步利用它们来控制现有图像描述模型所生成描述的模式。具体而言,所提出的DML优化了一个双分支架构,由图像条件离散变分自编码器(CdVAE)分支和模式条件图像描述(MIC)分支组成。CdVAE分支将每幅图像描述映射到学习到的码本中存储的某个模式嵌入,并以纯非自回归生成目标进行训练,以使各模式具有区分性与代表性。MIC分支可由现有图像描述模型简单修改得到,其中模式嵌入作为控制信号被加到原始词嵌入上。在实验中,我们将提出的DML应用于两个广泛使用的图像描述模型Transformer和AoANet。结果表明,学习到的模式嵌入成功促使这些模型生成具有不同模式的高质量图像描述,进而在MSCOCO数据集上同时提升了多样性与质量性能。
引用
@article{arxiv.2209.08231,
title = {Learning Distinct and Representative Styles for Image Captioning},
author = {Qi Chen and Chaorui Deng and Qi Wu},
journal= {arXiv preprint arXiv:2209.08231},
year = {2023}
}
备注
NeurIPS 2022