中文

利用协同注意力对齐符号与物体以理解视觉广告

计算机视觉与模式识别 2018-07-05 v1

摘要

我们解决理解视觉广告的问题:给定广告图像,我们的目标是为描述广告意图的人工生成语句排序。该问题通常通过联合嵌入图像与候选语句以建立对应关系来解决。解码视觉广告需要推断图像中所引用的语义与符号细微差别,而先前方法可能未能捕捉此类关联,尤其在弱标注符号情况下。为创建更好的嵌入,我们利用注意力机制将图像候选区域与符号关联,从而有效聚合来自对齐多模态表示的信息。我们提出一种多跳协同注意力机制,迭代细化注意力图以确保准确的注意力估计。我们基于注意力的嵌入模型以最大间隔损失函数为指导端到端学习。我们表明我们的模型在基准 Ad 数据集上优于其他基线,并展示定性结果以突显使用多跳协同注意力的优势。

关键词

引用

@article{arxiv.1807.01448,
  title  = {Understanding Visual Ads by Aligning Symbols and Objects using Co-Attention},
  author = {Karuna Ahuja and Karan Sikka and Anirban Roy and Ajay Divakaran},
  journal= {arXiv preprint arXiv:1807.01448},
  year   = {2018}
}

备注

Accepted at CVPR 2018 workshop- Towards Automatic Understanding of Visual Advertisements