面向语音、音乐与声学事件的表征基准测试
音频与语音处理
2024-09-17 v1 机器学习
声音
摘要
用于评估音频表征学习(ARL)方法的标准化基准的多样性有限,可能阻碍对现有方法能力的系统性比较。我们提出了 ARCH,一个用于在涵盖声学事件、音乐和语音等多样化音频分类领域评估 ARL 方法的综合基准。ARCH 包含 12 个数据集,使我们能够全面评估不同尺寸的预训练 SSL 模型。ARCH 通过其对广泛领域的统一访问能力以及轻松纳入新数据集和模型的能力,简化了 ARL 技术的基准测试。为了解决当前非语音音频缺乏开源预训练模型的问题,我们还发布了新的预训练模型,这些模型在非语音数据集上表现出色。我们认为,所呈现的广泛评估为最先进的 ARL 方法提供了有价值的见解,并有助于明确有前景的研究方向。
引用
@article{arxiv.2405.00934,
title = {Benchmarking Representations for Speech, Music, and Acoustic Events},
author = {Moreno La Quatra and Alkis Koudounas and Lorenzo Vaiani and Elena Baralis and Luca Cagliero and Paolo Garza and Sabato Marco Siniscalchi},
journal= {arXiv preprint arXiv:2405.00934},
year = {2024}
}