中文

面向通用音频分类的掩码音频编码器大规模学习

声音 2024-06-14 v2 音频与语音处理

摘要

尽管在音频分类方面取得了进展,但在语音与其他声音领域(如环境声和音乐)之间仍存在泛化差距。为语音任务训练的模型在环境或音乐音频任务上往往表现不佳,反之亦然。虽然自监督(SSL)音频表示提供了一种替代方案,但对 SSL 基于通用音频分类的模型与数据集规模的探索仍有限。我们引入 Dasheng,一个基于高效掩码自编码器框架的简单 SSL 音频编码器。该模型在 272,356 小时多样化音频上使用 120 亿参数进行训练,在 HEAR 基准测试上取得显著性能提升。在 CREMA-D、LibriCount、Speech Commands、VoxLingua 等任务上超越了以往工作,并在音乐和环境分类任务中表现出色。Dasheng 天然地包含丰富的语音、音乐和环境信息,正如最近邻分类实验所示。代码已公开 https://github.com/richermans/dasheng/。

关键词

引用

@article{arxiv.2406.06992,
  title  = {Scaling up masked audio encoder learning for general audio classification},
  author = {Heinrich Dinkel and Zhiyong Yan and Yongqing Wang and Junbo Zhang and Yujun Wang and Bin Wang},
  journal= {arXiv preprint arXiv:2406.06992},
  year   = {2024}
}

备注

Interspeech 2024