使用多种采样策略的通用音频表示自监督学习方法
声音
2025-05-27 v1 音频与语音处理
摘要
我们提出了一种使用多种采样策略以获取通用音频表示的自监督学习方法。该方法采用多种采样策略,从不同视角构建对比损失并基于此学习表示。本研究中,除了广泛使用的片段级采样策略外,我们还引入了两种新策略:帧级策略和任务特定策略。所提出的多种策略提升了帧级分类及其他任务(如音高检测)的性能,而这些是传统单一片段级采样策略未重点关注的部分。我们在 Audioset 的子集上对该方法进行了预训练,并在冻结权重下将其应用于下游任务。所提方法将片段分类、声音事件检测和音高检测的性能分别提升了 25%、20% 和 3.6%。
引用
@article{arxiv.2505.18984,
title = {Self-supervised learning method using multiple sampling strategies for general-purpose audio representation},
author = {Ibuki Kuroyanagi and Tatsuya Komatsu},
journal= {arXiv preprint arXiv:2505.18984},
year = {2025}
}
备注
5 pages, 1 figure, 2 tables, ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)