中文

面向营销分析的多模态图像描述生成

计算机视觉与模式识别 2019-08-07 v2

摘要

用自然语言句子自动描述图像是一项重要的研究课题。当前最先进(SOTA)的模型已能生成类人句子。这些模型通常将所描绘场景作为一个整体进行描述,并不针对图像中感兴趣的特定对象或这些对象之间的情感关系。然而,营销公司需要对给定场景的这些重要属性进行描述。在我们的案例中,感兴趣对象是消费品,通常可通过产品标识(logo)识别并与特定品牌关联。从营销角度看,还需评估商标产品的情感语境,即其以正面或负面含义出现。我们通过引入一种改进的图像描述网络,解决图像中品牌发现与对应描述生成的问题。我们还添加了第三种输出模态,可同时产生实值图像评分。我们的网络采用分类感知损失函数进行训练,以促使生成强调标识产品品牌的词汇的句子。我们在描绘人与品牌产品交互的图像数据集上评估了模型。所引入的网络将平均类别准确率提升了 24.5%。得益于第三种输出模态的加入,其也显著改善了描绘品牌产品的生成描述质量。

关键词

引用

@article{arxiv.1802.01958,
  title  = {Multimodal Image Captioning for Marketing Analysis},
  author = {Philipp Harzig and Stephan Brehm and Rainer Lienhart and Carolin Kaiser and René Schallner},
  journal= {arXiv preprint arXiv:1802.01958},
  year   = {2019}
}

备注

4 pages, 1 figure, accepted at MIPR2018