探索用于通用音频理解的联邦自监督学习
声音
2024-02-07 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
联邦学习(FL)与自监督学习(SSL)的整合提供了一种独特且协同的组合,可在不损害用户数据隐私的前提下利用音频数据进行通用音频理解。然而,很少有人努力研究 FL 体制下用于通用音频理解的 SSL 模型,特别是当训练数据由大规模异构音频源生成时。在本文中,我们评估了特征匹配和预测性音频 SSL 技术在集成到模拟非独立同分布(non-iid)数据的大规模 FL 设置时的性能。我们提出了一种新颖的联邦 SSL(F-SSL)框架,名为 FASSL,能够从持有未标记音频数据的大规模去中心化异构客户端中学习中间特征表示。我们的研究发现,音频 F-SSL 方法在音频检索任务上的表现与集中式音频 SSL 方法相当。大量实验证明了 FASSL 的有效性和重要性,因为它有助于为最先进的 FL 聚合方法获得最优的全局模型。
引用
@article{arxiv.2402.02889,
title = {Exploring Federated Self-Supervised Learning for General Purpose Audio Understanding},
author = {Yasar Abbas Ur Rehman and Kin Wai Lau and Yuyang Xie and Lan Ma and Jiajun Shen},
journal= {arXiv preprint arXiv:2402.02889},
year = {2024}
}