使用 Tag2Vec 学习为视频添加 Hash-tag
计算机视觉与模式识别
2016-12-14 v1 计算与语言
摘要
用户提供的标签或标注是图像和视频等视觉媒体语义理解的宝贵资源。最近,一种被称为 hash-tag 的新型标注机制在社交媒体网站上变得越来越流行。在本文中,我们研究了为短视频片段生成相关且有用的 hash-tag 的问题。传统的用于标签丰富和推荐的基于数据驱动的方法使用直接视觉相似性进行标签转移和传播。我们尝试使用两步训练过程学习从视频到 hash-tag 的直接低成本映射。我们首先采用自然语言处理(NLP)技术,即带有神经网络训练的 skip-gram 模型,利用 1000 万个 hash-tag 的语料库学习 hash-tag 的低维向量表示(Tag2Vec)。然后,我们训练一个嵌入函数,将视频特征映射到低维 Tag2vec 空间。我们针对带有 hash-tag 的 29 类短视频片段学习该嵌入。没有任何标签信息的查询视频随后可以使用学习到的嵌入直接映射到标签的向量空间,并且可以通过在 Tag2Vec 空间中执行简单的最近邻检索来找到相关标签。我们通过用户研究,定性和定量地验证了系统所推荐标签的相关性。
引用
@article{arxiv.1612.04061,
title = {Learning to Hash-tag Videos with Tag2Vec},
author = {Aditya Singh and Saurabh Saini and Rajvi Shah and PJ Narayanan},
journal= {arXiv preprint arXiv:1612.04061},
year = {2016}
}