中文

JTAV:通过融合文本、声学与视觉特征联合学习社交媒体内容表示

计算与语言 2021-03-24 v2

摘要

学习社交媒体内容是许多现实应用(包括信息检索和推荐系统等)的基础。与以往主要关注单模态或双模态学习的工作不同,我们提出通过联合融合文本、声学和视觉信息(JTAV)来学习社交媒体内容。提出了提取各模态细粒度特征的有效策略,即 attBiGRU 和 DCRNN。我们还引入跨模态融合与注意力池化技术来全面整合多模态信息。在真实世界数据集上进行的广泛实验评估表明,我们提出的模型大幅优于最先进的方法。

关键词

引用

@article{arxiv.1806.01483,
  title  = {JTAV: Jointly Learning Social Media Content Representation by Fusing Textual, Acoustic, and Visual Features},
  author = {Hongru Liang and Haozheng Wang and Jun Wang and Shaodi You and Zhe Sun and Jin-Mao Wei and Zhenglu Yang},
  journal= {arXiv preprint arXiv:1806.01483},
  year   = {2021}
}