基于跨模态注意力与语言的音视觉广义零样本学习
计算机视觉与模式识别
2022-04-05 v2 计算与语言
音频与语音处理
摘要
学习对训练数据中未包含类别的视频数据进行分类,即基于视频的零样本学习,是具有挑战性的。我们推测视频数据中音频与视觉模态之间的自然对齐为学习有判别力的多模态表示提供了丰富的训练信号。聚焦于相对未被充分探索的音视觉零样本学习任务,我们提出使用跨模态注意力从音视觉数据中学习多模态表示,并利用文本标签嵌入将知识从已见类别迁移到未见类别。更进一步,在我们的广义音视觉零样本学习设定中,我们将所有训练类别纳入测试时搜索空间,它们作为干扰项增加了难度,同时使设定更贴近现实。由于该领域缺乏统一基准,我们在三个不同规模和难度的音视觉数据集 VGGSound、UCF 和 ActivityNet 上引入了(广义)零样本学习基准,确保未见测试类别不出现在用于骨干深度模型监督训练的数据集中。通过比较多种相关且近期的方法,我们证明了我们提出的 AVCA 模型在所有三个数据集上达到了最先进的性能。代码和数据可在 \url{https://github.com/ExplainableML/AVCA-GZSL} 获取。
引用
@article{arxiv.2203.03598,
title = {Audio-visual Generalised Zero-shot Learning with Cross-modal Attention and Language},
author = {Otniel-Bogdan Mercea and Lukas Riesch and A. Sophia Koepke and Zeynep Akata},
journal= {arXiv preprint arXiv:2203.03598},
year = {2022}
}
备注
CVPR 2022