3M:基于多 UPDOWN 模型利用多模态特征的多风格图像描述生成
计算机视觉与模式识别
2021-03-23 v1
摘要
本文构建了一个用于风格化图像描述生成的多风格生成模型,该模型使用多模态图像特征、ResNeXt 特征以及由 DenseCap 生成的文本特征。我们提出了 3M 模型,一种编码多模态特征并将其解码为描述的多 UPDOWN 描述模型。我们通过在两个数据集 PERSONALITY-CAPTIONS 和 FlickrStyle10K 上的性能检验,展示了我们的模型在生成类人描述方面的有效性。我们在 BLEU、ROUGE-L、CIDEr、SPICE 等多种自动 NLP 指标上与多种 SOTA 基线进行了比较。我们还进行了定性研究,以验证我们的 3M 模型可用于生成不同的风格化描述。
引用
@article{arxiv.2103.11186,
title = {3M: Multi-style image caption generation using Multi-modality features under Multi-UPDOWN model},
author = {Chengxi Li and Brent Harrison},
journal= {arXiv preprint arXiv:2103.11186},
year = {2021}
}
备注
To be published at FLAIRS-34