中文

面向听力设备的听觉场景识别数据集与模型:AHEAD-DS与OpenYAMNet

声音 2026-01-14 v5 音频与语音处理

摘要

场景识别对听力设备至关重要,然而这具有挑战性,部分原因是现有数据集的局限性。数据集往往缺乏公共可访问性、完整性或听力学相关的标签,阻碍了机器学习模型的系统性比较。在资源受限的边缘设备上部署此类模型则带来了另一个挑战。我们提出的解决方案包含两个方面:一是对多个开源数据集进行重新打包和精炼,以创建AHEAD-DS,一个专为听力设备听觉场景识别设计的数据集;二是引入OpenYAMNet,一个声音识别模型。AHEAD-DS旨在提供一个标准化、公开可用的数据集,具有与助听器相关的一致标签,以促进模型比较。OpenYAMNet专为部署在连接听力设备(如助听器和具有助听功能的无线耳机)的智能手机等边缘设备上而设计,作为基于声音的场景识别的基线模型。在AHEAD-DS测试集上,OpenYAMNet在14个与听觉场景识别相关的类别中取得了0.86的平均精度均值和0.93的准确率。通过将OpenYAMNet部署到安卓智能手机上,展示了在边缘设备上进行实时声音场景识别的能力。即使是使用2018年发布的、规格一般的谷歌Pixel 3手机,该模型处理音频的延迟约为加载模型50毫秒,且每1秒音频近似线性增加30毫秒。项目网站包含代码、数据和模型的链接:https://github.com/Australian-Future-Hearing-Initiative

关键词

引用

@article{arxiv.2508.10360,
  title  = {A dataset and model for auditory scene recognition for hearing devices: AHEAD-DS and OpenYAMNet},
  author = {Henry Zhong and Jörg M. Buchholz and Julian Maclaren and Simon Carlile and Richard Lyon},
  journal= {arXiv preprint arXiv:2508.10360},
  year   = {2026}
}