OpenBEATs:面向通用音频编码的完全开源框架
声音
2025-07-21 v1 音频与语音处理
摘要
掩码标记预测已成为语言、视觉和语音等领域中强大的预训练目标,具有将这些多模态统一为单一预训练任务的潜力。然而,其在通用音频理解中的应用仍鲜有探索,只有BEATs是一个值得注意的例子。由于缺乏开源预训练代码,BEATs的修改有限。此外,BEATs仅在AudioSet上训练,限制了其更广泛的下游应用。为此,我们提出OpenBEATs,一个开源框架,通过多域音频预训练扩展BEATs。我们在六类任务、二十五个数据集和三个音频领域进行了全面评估,包括音频问答、推理和表述等音频推理任务。OpenBEATs在六个生物声学数据集、两个环境声数据集和五个推理数据集上实现最先进性能,在参数规模为四分之一的情况下表现优于参数超过十亿的模型。这些结果表明,多域数据集和掩码标记预测任务有效学习了通用音频表征。为促进进一步的研究和可重复性,我们在https://shikhar-s.github.io/OpenBEATs发布了所有预训练和评估代码、预训练和微调检查点以及训练日志。
引用
@article{arxiv.2507.14129,
title = {OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder},
author = {Shikhar Bharadwaj and Samuele Cornell and Kwanghee Choi and Satoru Fukayama and Hye-jin Shim and Soham Deshmukh and Shinji Watanabe},
journal= {arXiv preprint arXiv:2507.14129},
year = {2025}
}