中文

3M:基于多 UPDOWN 模型利用多模态特征的多风格图像描述生成

计算机视觉与模式识别 2021-03-23 v1

摘要

本文构建了一个用于风格化图像描述生成的多风格生成模型,该模型使用多模态图像特征、ResNeXt 特征以及由 DenseCap 生成的文本特征。我们提出了 3M 模型,一种编码多模态特征并将其解码为描述的多 UPDOWN 描述模型。我们通过在两个数据集 PERSONALITY-CAPTIONS 和 FlickrStyle10K 上的性能检验,展示了我们的模型在生成类人描述方面的有效性。我们在 BLEU、ROUGE-L、CIDEr、SPICE 等多种自动 NLP 指标上与多种 SOTA 基线进行了比较。我们还进行了定性研究,以验证我们的 3M 模型可用于生成不同的风格化描述。

关键词

引用

@article{arxiv.2103.11186,
  title  = {3M: Multi-style image caption generation using Multi-modality features under Multi-UPDOWN model},
  author = {Chengxi Li and Brent Harrison},
  journal= {arXiv preprint arXiv:2103.11186},
  year   = {2021}
}

备注

To be published at FLAIRS-34