基于SVD的循环专家混合的多样且风格化图像描述生成
计算机视觉与模式识别
2022-02-03 v1 计算与语言
机器学习
摘要
随着视觉和自然语言处理的巨大进步,图像描述生成成为一种需求。在最近的一篇论文中,Mathews、Xie和He [1]扩展了一个新模型,通过分离语义与风格来生成风格化描述。作为该工作的延续,本文开发了一种新的描述生成模型,包括一个用于提取特征的图像编码器、一个将提取特征集合嵌入到词集合的循环网络混合,以及一个将所得词组合为风格化句子的句子生成器。所得系统被称为循环专家混合(Mixture of Recurrent Experts, MoRE),使用了一种新训练算法,该算法从循环神经网络(RNNs)的加权矩阵导出奇异值分解(SVD)以增加描述的多样性。每个分解步骤依赖于一个基于MoRE中RNN数量的区别性因子。由于所用的句子生成器给出无配对图像的风格化语言语料,我们的描述模型也能如此。此外,风格化和多样化描述是在无需在密集标注或风格化数据集上训练的情况下提取的。为验证该描述模型,我们使用Microsoft COCO这一标准事实性图像描述数据集。我们表明所提出的描述模型能生成多样且风格化的图像描述,而无需额外标注。结果还显示了在内容准确性方面更好的描述。
引用
@article{arxiv.2007.03338,
title = {Diverse and Styled Image Captioning Using SVD-Based Mixture of Recurrent Experts},
author = {Marzieh Heidari and Mehdi Ghatee and Ahmad Nickabadi and Arash Pourhasan Nezhad},
journal= {arXiv preprint arXiv:2007.03338},
year = {2022}
}
备注
13 pages, 4 figures and 5 tables, extracted from an MSc thesis in the Amirkabir University of Technology, Tehran, Iran