面向未见活动的多模态表示学习
计算机视觉与模式识别
2020-07-08 v4
摘要
我们提出一种学习联合多模态表示空间的方法,以实现视频中未见活动的识别。我们首先比较了利用成对的文本与视频数据对嵌入空间施加不同约束的效果。我们还提出了一种通过对抗式形式改进联合嵌入空间的方法,使其能利用未配对的文本和视频数据。通过使用未配对文本数据,我们展示了学习一种能更好刻画未见活动的表示的能力。除在公开可用数据集上测试外,我们引入了一个全新的大规模文本/视频数据集。我们通过实验证实,利用成对与未配对数据学习共享嵌入空间有助于三项困难任务:(i) 零样本活动分类,(ii) 无监督活动发现,以及 (iii) 未见活动描述生成,并优于当前最优方法。
引用
@article{arxiv.1806.08251,
title = {Learning Multimodal Representations for Unseen Activities},
author = {AJ Piergiovanni and Michael S. Ryoo},
journal= {arXiv preprint arXiv:1806.08251},
year = {2020}
}