面向音视觉零样本学习的时序与跨模态注意力
计算机视觉与模式识别
2022-07-21 v1
摘要
用于视频分类的音视觉广义零样本学习需要理解音频与视觉信息之间的关系,以便能够在测试时识别来自新颖、先前未见类别的样本。视频数据中音频与视觉数据之间天然语义与时序对齐可被用来学习可泛化至测试时未见类别的强大表征。我们提出一种用于音视觉广义零样本学习的多模态时序跨注意力框架(\modelName)。其输入为从预训练网络获得的时序对齐音频与视觉特征。促使框架关注跨时间跨模态对应而非模态内自注意力,可显著提升性能。我们表明,所提摄入时序特征的框架在 \ucf、\vgg 和 \activity 基准上取得了(广义)零样本学习的 SOTA 性能。复现所有结果的代码见 \url{https://github.com/ExplainableML/TCAF-GZSL}。
引用
@article{arxiv.2207.09966,
title = {Temporal and cross-modal attention for audio-visual zero-shot learning},
author = {Otniel-Bogdan Mercea and Thomas Hummel and A. Sophia Koepke and Zeynep Akata},
journal= {arXiv preprint arXiv:2207.09966},
year = {2022}
}
备注
ECCV 2022