HAVE-Net:面向单模态线索少样本分类的幻觉音视觉嵌入
计算机视觉与模式识别
2023-09-26 v1
摘要
遥感(RS)或航拍图像识别当前备受关注,近年深度学习的进展更添助力。使用单模态RS视觉输入训练神经网络时,可能出现遮挡、类内方差、光照等问题。尽管音视觉模态联合训练可提升低数据 regime 下分类性能,其在RS领域尚待深入探究。本文旨在解决一新问题:少样本学习(FSL)分类器元训练时音视觉模态均存在,但元测试阶段可能缺失其一。鉴于RS领域数据采集困难或传感器故障,该问题设定颇具现实意义。为此,我们提出新颖少样本生成框架——幻觉音视觉嵌入网络(HAVE-Net),从有限单模态数据元训练跨模态特征。确切地说,这些幻觉特征从基类元学习得到,并在推理阶段用于新类的少样本分类。在基准ADVANCE与AudioSetZSL数据集上的实验表明,我们的幻觉模态增强策略用于少样本分类,至少超越以真实多模态信息训练的分类器性能0.8–2%。
引用
@article{arxiv.2309.13470,
title = {HAVE-Net: Hallucinated Audio-Visual Embeddings for Few-Shot Classification with Unimodal Cues},
author = {Ankit Jha and Debabrata Pal and Mainak Singha and Naman Agarwal and Biplab Banerjee},
journal= {arXiv preprint arXiv:2309.13470},
year = {2023}
}
备注
8 Page, 2 Figures, 2 Tables, Accepted in Adapting to Change: Reliable Multimodal Learning Across Domains Workshop, ECML PKDD 2023