中文

HEAR:音频表示的整体性评测

声音 2025-06-18 v3 人工智能 机器学习 音频与语音处理 机器学习

摘要

哪种音频嵌入方法能在不进行微调的情况下,最好地泛化到跨多种日常领域的广泛下游任务?HEAR基准的目标是开发一种通用音频表示,为在各种任务和场景中学习提供坚实基础。HEAR使用一套跨多种领域(包括语音、环境声音和音乐)的基准套件来评估音频表示。HEAR作为NeurIPS 2021共享挑战赛启动。本着共享交流的精神,每位参与者提交了一个遵循通用API的音频嵌入模型,该API通用、开源且可免费使用。来自十三个外部团队的二十九个模型在源自十六个数据集的十九个多样化下游任务上进行了评估。开放的评估代码、提交的模型与数据集是关键贡献,实现了全面且可复现的评估,以及此前不可能的纵向研究。是否可能存在单一通用音频表示能像人耳一样整体地表现,这仍是一个开放问题。

关键词

引用

@article{arxiv.2203.03022,
  title  = {HEAR: Holistic Evaluation of Audio Representations},
  author = {Joseph Turian and Jordie Shier and Humair Raj Khan and Bhiksha Raj and Björn W. Schuller and Christian J. Steinmetz and Colin Malloy and George Tzanetakis and Gissel Velarde and Kirk McNally and Max Henry and Nicolas Pinto and Camille Noufi and Christian Clough and Dorien Herremans and Eduardo Fonseca and Jesse Engel and Justin Salamon and Philippe Esling and Pranay Manocha and Shinji Watanabe and Zeyu Jin and Yonatan Bisk},
  journal= {arXiv preprint arXiv:2203.03022},
  year   = {2025}
}

备注

to appear in Proceedings of Machine Learning Research (PMLR): NeurIPS 2021 Competition Track