中文

潜在多视图学习用于稳健环境声表征

声音 2025-10-29 v3

摘要

自监督学习(SSL)方法,如对比学习和生成方法,已推动环境声表征学习使用无标签数据。然而,这些方法如何在统一框架内相互补充仍相对未被充分探索。本文提出一种多视图学习框架,将对比原理整合到生成管道中,以捕获声源和设备信息。该方法将压缩音频潜在特征编码到特定视图和公共视图子空间,依据两个自监督目标进行引导:对比学习实现子空间之间针对特定信息的定向流,重建实现整体信息的保留。我们在城市声音传感器网络数据集上评估了该方法,用于声源和传感器分类,显示优于传统SSL技术的下游性能。此外,我们还在不同训练配置下研究了模型在结构化潜在空间中解耦环境声属性的潜力。

关键词

引用

@article{arxiv.2510.02500,
  title  = {Latent Multi-view Learning for Robust Environmental Sound Representations},
  author = {Sivan Ding and Julia Wilkins and Magdalena Fuentes and Juan Pablo Bello},
  journal= {arXiv preprint arXiv:2510.02500},
  year   = {2025}
}

备注

Accepted to DCASE 2025 Workshop. 4+1 pages, 2 figures, 2 tables