音频-视觉广义零样本学习:简单有效的方法
计算机视觉与模式识别
2024-07-19 v1 机器学习
多媒体
声音
音频与语音处理
摘要
音频-视觉广义零样本学习是一个快速发展的领域,旨在理解视频中音频与视觉线索之间的复杂关系。其总体目标是利用来自已见类的见解来识别以前未见过的实例。先前的方法主要利用同步自动编码器来重建音频-视觉属性,这些方法受到跨注意力变换器和投影文本嵌入所提供的跨模态信息所驱动。然而,这些方法不足以有效捕捉预训练语言对齐嵌入中跨模态特征与类别标签嵌入之间固有的复杂关系。为克服这些瓶颈,我们引入了一个简单而有效的框架,用于易于音频-视觉广义零样本学习,命名为EZ-AVGZL,通过对齐音频-视觉嵌入与转换后的文本表示来实现。它利用单个监督文本音频-视觉对比损失来学习音频-视觉与文本模态之间的对齐,摆脱了常规方法中重建跨模态特征和文本嵌入的做法。我们的关键见解是,尽管类别名称嵌入与基于语言的音频-视觉特征对齐良好,但它们不足以提供足够的类别分离以用于零样本学习。为此,我们的方法利用差分优化将类别嵌入转换为更具辨识力的空间,同时保持语言表示的语义结构。我们在VGGSound-GZSL、UCF-GZSL和ActivityNet-GZSL基准上进行了大量实验。我们的结果表明,EZ-AVGZL在音频-视觉广义零样本学习方面实现了最先进的性能。
引用
@article{arxiv.2407.13095,
title = {Audio-visual Generalized Zero-shot Learning the Easy Way},
author = {Shentong Mo and Pedro Morgado},
journal= {arXiv preprint arXiv:2407.13095},
year = {2024}
}