如何训练你的耳朵:面向大动态范围输入与中重度听力损失的听觉模型仿真
音频与语音处理
2024-03-18 v1
摘要
高级听觉模型在设计用于听力损失补偿或语音增强的信号处理算法时非常有用。这些听觉模型提供了对听觉通路的丰富而详细的描述,并可能允许基于生理测量对信号处理策略进行个性化定制。然而,这些听觉模型通常计算要求高,需要大量时间来计算。为了解决这个问题,先前的研究探索了使用深度神经网络来仿真听觉模型并减少推理时间。虽然这些深度神经网络在计算时间方面提供了显著的效率提升,但它们的仿真性能可能会随听觉模型频率通道和输入声压级的变化而出现不均匀,使其不适用于许多任务。在本研究中,我们证明了现有 SOTA 方法中使用的传统机器学习优化目标是这一局限性的主要来源。具体而言,该优化目标未能考虑听觉模型的频率和水平依赖性,这是由大的输入动态范围和听觉模型仿真的不同类型的听力损失引起的。为了克服这一局限性,我们提出了一种新的优化目标,显式地嵌入了听觉模型的频率和水平依赖性。我们的结果表明,这种新的优化目标显著提高了深度神经网络在相关输入声级和听觉模型频率通道上的仿真性能,而没有增加推理期间的计算负荷。解决这些局限性对于推动听觉模型在信号处理任务中的应用至关重要,以确保其在各种场景中的有效性。
引用
@article{arxiv.2403.10428,
title = {How to train your ears: Auditory-model emulation for large-dynamic-range inputs and mild-to-severe hearing losses},
author = {Peter Leer and Jesper Jensen and Zheng-Hua Tan and Jan Østergaard and Lars Bramsløw},
journal= {arXiv preprint arXiv:2403.10428},
year = {2024}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing. This version is the authors' version and may vary from the final publication in details