中文

差异感知注意力网络用于增强音频-视觉零样本学习

计算机视觉与模式识别 2024-12-17 v1 多媒体 声音 音频与语音处理

摘要

音频-视觉零样本学习(ZSL)因其识别未见类并在视频分类任务中表现良好而受到关注。然而,(G)ZSL中的模态不平衡导致过度依赖最优模态,降低了对未见类的判别能力。一些研究尝试通过修改参数梯度来解决此问题,但仍存在两个挑战:(a) 质量差异,即不同模态对同一概念提供不同数量和质量的语义信息。(b) 内容差异,即模态内样本贡献差异显著。为应对这些挑战,我们提出差异感知注意力网络(DAAN)用于增强音频-视觉ZSL。我们的方法引入质量差异缓解注意力(QDMA)单元以减少高质量模态中的冗余信息,以及对比样本级梯度调制(CSGM)块以调整梯度幅度并平衡内容差异。我们通过整合优化和收敛率来量化模态贡献,以实现CSGM中更精确的梯度调制。实验表明DAAN在基准数据集上达到最先进性能,消融研究验证了各模块的有效性。

关键词

引用

@article{arxiv.2412.11715,
  title  = {Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning},
  author = {RunLin Yu and Yipu Gong and Wenrui Li and Aiwen Sun and Mengren Zheng},
  journal= {arXiv preprint arXiv:2412.11715},
  year   = {2024}
}