中文

FSSUAVL:基于视觉模型的联邦自监督音频与图像理解判别框架

声音 2025-04-15 v1 计算机视觉与模式识别 音频与语音处理

摘要

最近的研究表明,视觉模型在配对的音频图像情景下能够有效学习到多模态表示。然而,使深度模型从未配对的模态中学习表示的挑战仍未得到解决。这在联邦学习(FL)等场景中尤为突出,此时数据往往是分散的、异构的,且无法可靠保证存在配对数据。以往的做法通过在本地客户端使用辅助预训练编码器或生成模型,虽然解决了问题,但随着模态数量的增加会导致计算成本的上升。与这些方法不同,本文提出了FSSUAVL(Federated Self-Supervised Audio and Image Vision Learning),该方法在联邦学习环境下通过自监督对比学习(SSL)进行预训练。FSSUAVL不通过对齐音频和图像模态,而是将其投影到共享嵌入空间中,以判别性方式联合学习。这种设计扩展了FSSUAVL的适用范围,既适用于配对音频图像识别任务,也适用于未配对任务。我们的实验使用CNN和ViT模型表明,FSSUAVL在各种图像和音频基准任务上的性能显著优于为每个模态分别构建深度模型的做法。此外,FSSUAVL能够学习多模态特征表示,从而能够集成辅助信息,以提升识别精度。

关键词

引用

@article{arxiv.2504.09516,
  title  = {FSSUAVL: A Discriminative Framework using Vision Models for Federated Self-Supervised Audio and Image Understanding},
  author = {Yasar Abbas Ur Rehman and Kin Wai Lau and Yuyang Xie and Ma Lan and JiaJun Shen},
  journal= {arXiv preprint arXiv:2504.09516},
  year   = {2025}
}

备注

8 pages