中文

面向视频广义视听零样本分类与检索的协调联合多模态嵌入

计算机视觉与模式识别 2019-10-22 v1 多媒体 声音 音频与语音处理

摘要

我们提出一种视听多模态方法,用于视频的零样本学习(ZSL)分类与检索任务。ZSL 在近年已被广泛研究,但主要局限于视觉模态与图像。我们证明音频与视觉模态对视频的 ZSL 均十分重要。由于目前尚无研究该任务的数据集,我们基于现有大规模音频事件数据集构建了一个包含 33 类、156,416 个视频的相应多模态数据集。我们通过实验表明,在使用嵌入学习方法的多种模态扩展时,加入音频模态可提升零样本分类与检索两项任务的性能。我们还提出一种利用联合学习的模态注意力网络预测“主导”模态的新方法。我们在半监督设定下学习注意力,因此无需任何额外的模态显式标注。我们给出了模态特定注意力的定性验证,其也能成功泛化至未见测试类。

关键词

引用

@article{arxiv.1910.08732,
  title  = {Coordinated Joint Multimodal Embeddings for Generalized Audio-Visual Zeroshot Classification and Retrieval of Videos},
  author = {Kranti Kumar Parida and Neeraj Matiyali and Tanaya Guha and Gaurav Sharma},
  journal= {arXiv preprint arXiv:1910.08732},
  year   = {2019}
}

备注

To appear in WACV 2020, Project Page: https://cse.iitk.ac.in/users/kranti/avzsl.html