跨媒体关键词预测:基于多模态多头注意力与图像文本的统一框架
计算机视觉与模式识别
2020-11-04 v1 计算与语言
摘要
社交媒体每天产生大量内容。为了帮助用户快速获取所需信息,关键词预测正受到越来越多的关注。然而,以往大多数工作聚焦于文本建模,很大程度上忽略了匹配图像中蕴含的丰富特征。在本工作中,我们探索文本与图像在预测多媒体帖子关键词时的联合作用。为了更好地对齐社交媒体风格文本与图像,我们提出:(1)一种新颖的多模态多头注意力(M3H-Att)以捕捉复杂的跨媒体交互;(2)以光学字符和图像属性形式呈现的图像文本,以桥接两种模态。此外,我们设计了一个统一框架,以利用关键词分类与生成的输出并耦合其优势。在新近从 Twitter 收集的大规模数据集上的大量实验表明,我们的模型显著优于基于传统注意力网络的先前最优方法。进一步分析表明,我们的多头注意力能够从多个方面关注信息,并在多样场景中提升分类或生成效果。
引用
@article{arxiv.2011.01565,
title = {Cross-Media Keyphrase Prediction: A Unified Framework with Multi-Modality Multi-Head Attention and Image Wordings},
author = {Yue Wang and Jing Li and Michael R. Lyu and Irwin King},
journal= {arXiv preprint arXiv:2011.01565},
year = {2020}
}
备注
EMNLP 2020 (14 pages)