Deep Audio Representations for Hearables 评估
声音
2025-02-25 v2 人工智能
机器学习
摘要
有效地引导听戴设备需要理解围绕用户的声学环境。在声音场景的计算分析中,基础模型已成为生产高性能、稳健、多用途音频表示的技术领先方法。我们介绍并发布 Deep Evaluation of Audio Representations(DEAR),这是第一个用于评估基础模型在捕获听戴设备所需关键声学属性方面效果的数据集和基准。该数据集包含 1,158 个音频轨道,每个音频轨道长度为 30 秒,由空间混合专利的单声道录音与商业高质量日常声学场景录音创建。我们的基准涵盖八个任务,用于评估音频场景的通用上下文、语音来源和技术声学属性。通过对四个通用音频表示模型的评估,我们展示 BEATs 模型显著优于其它模型。这种优势强调了在多样化音频数据集上训练的模型优势,确认其适用于广泛的听觉任务,包括编码听戴设备所需的环境属性。DEAR 数据集及相关代码已发布于 https://dear-dataset.github.io。
引用
@article{arxiv.2502.06664,
title = {Evaluation of Deep Audio Representations for Hearables},
author = {Fabian Gröger and Pascal Baumann and Ludovic Amruthalingam and Laurent Simon and Ruksana Giurda and Simone Lionetti},
journal= {arXiv preprint arXiv:2502.06664},
year = {2025}
}
备注
Accepted at International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)