基于多词性嵌入的细粒度动作检索
计算机视觉与模式识别
2019-08-12 v1
摘要
我们解决了文本与视频之间的跨模态细粒度动作检索问题。跨模态检索通常通过学习的共享嵌入空间来实现,该空间可无差别地嵌入不同模态。本文中,我们提出通过解耦伴随字幕中的词性(PoS)来丰富嵌入。我们为每个 PoS 标签构建独立的多模态嵌入空间。多个 PoS 嵌入的输出随后用作集成多模态空间的输入,在该空间中执行动作检索。所有嵌入通过 PoS 感知与 PoS 无关损失的组合进行联合训练。我们的方案能够学习专门的嵌入空间,提供同一嵌入实体的多种视图。我们报告了在大规模 EPIC 数据集上广义零样本设定下细粒度动作的首个检索结果。结果显示了我们的方法在视频到文本与文本到视频动作检索中的优势。我们还展示了在 MSR-VTT 数据集上解耦 PoS 对跨模态视频检索通用任务的益处。
引用
@article{arxiv.1908.03477,
title = {Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings},
author = {Michael Wray and Diane Larlus and Gabriela Csurka and Dima Damen},
journal= {arXiv preprint arXiv:1908.03477},
year = {2019}
}
备注
Accepted for presentation at ICCV. Project Page: https://mwray.github.io/FGAR