中文

面向微视频缩略图选择的多标签视觉-语义嵌入模型

信息检索 2022-02-08 v1 计算机视觉与模式识别

摘要

缩略图作为微视频的第一印象,在吸引用户点击观看中起着关键作用。而在实际场景中,缩略图越能满足用户,微视频被点击的可能性就越大。本文旨在为给定微视频选择符合大多数用户兴趣的缩略图。为此,我们提出一种多标签视觉-语义嵌入模型,以估计每帧与用户感兴趣热门话题之间对的相似度。该模型将视觉与文本信息嵌入共享语义空间,从而可直接度量相似度,即便遇未见词。此外,为将帧与热门话题所有词比较,我们设计了关联语义注意力投影的注意力嵌入空间。借助这两个嵌入空间,帧的流行度得分(定义为相应视觉信息与热门话题对的相似度得分之和)得以获得。最终,我们融合每帧的视觉表征得分与流行度得分,为给定微视频选择具吸引力的缩略图。在真实数据集上的大量实验充分验证,我们的模型显著优于若干最优基线。

关键词

引用

@article{arxiv.2202.02930,
  title  = {Towards Micro-video Thumbnail Selection via a Multi-label Visual-semantic Embedding Model},
  author = {Liu Bo},
  journal= {arXiv preprint arXiv:2202.02930},
  year   = {2022}
}