面向通用音频分类的掩码音频编码器大规模学习
声音
2024-06-14 v2 音频与语音处理
摘要
尽管在音频分类方面取得了进展,但在语音与其他声音领域(如环境声和音乐)之间仍存在泛化差距。为语音任务训练的模型在环境或音乐音频任务上往往表现不佳,反之亦然。虽然自监督(SSL)音频表示提供了一种替代方案,但对 SSL 基于通用音频分类的模型与数据集规模的探索仍有限。我们引入 Dasheng,一个基于高效掩码自编码器框架的简单 SSL 音频编码器。该模型在 272,356 小时多样化音频上使用 120 亿参数进行训练,在 HEAR 基准测试上取得显著性能提升。在 CREMA-D、LibriCount、Speech Commands、VoxLingua 等任务上超越了以往工作,并在音乐和环境分类任务中表现出色。Dasheng 天然地包含丰富的语音、音乐和环境信息,正如最近邻分类实验所示。代码已公开 https://github.com/richermans/dasheng/。
引用
@article{arxiv.2406.06992,
title = {Scaling up masked audio encoder learning for general audio classification},
author = {Heinrich Dinkel and Zhiyong Yan and Yongqing Wang and Junbo Zhang and Yujun Wang and Bin Wang},
journal= {arXiv preprint arXiv:2406.06992},
year = {2024}
}
备注
Interspeech 2024