中文

用多阶段神经网络解读听力图

计算机视觉与模式识别 2021-12-20 v1 声音 音频与语音处理

摘要

听力图是一种特殊的折线图,表示个体在不同频率下的听力水平。听力学家利用它们诊断听力损失,并进一步为客户选择和调试合适的助听器。已有若干项目(如Autoaudio)旨在通过机器学习加速这一过程。但现有模型至多只能在图像中检测听力图并将其分类为一般类别。它们无法通过对标记、坐标轴和线条的解读从检测到的听力图中提取听力水平信息。为解决此问题,我们提出了一种多阶段听力图解读网络(MAIN),可直接从听力图照片中读取听力水平数据。我们还建立了Open Audiogram,一个带有标记和坐标轴标注的听力图图像开放数据集,并在其上训练和评估了我们所提出的模型。实验表明,我们的模型可行且可靠。

关键词

引用

@article{arxiv.2112.09357,
  title  = {Interpreting Audiograms with Multi-stage Neural Networks},
  author = {Shufan Li and Congxi Lu and Linkai Li and Jirong Duan and Xinping Fu and Haoshuai Zhou},
  journal= {arXiv preprint arXiv:2112.09357},
  year   = {2021}
}

备注

12pages,12 figures. The code for this project is available at https://github.com/jacklishufan/MAIN2021