中文

基于仿射调制的听力图融合网络:联合降噪与听力损失补偿

音频与语音处理 2025-09-10 v1

摘要

助听器(HAs)被广泛用于提供个性化语音增强(PSE)服务,以提高听力损失患者的生活质量。然而,助听器的性能在嘈杂环境中显著下降,因为它将降噪(NR)和听力损失补偿(HLC)视为独立的任务。这种分离导致缺乏系统性优化,忽略了这两个关键任务之间的相互作用,并增加了系统复杂性。为了应对这些挑战,我们提出了一种新颖的听力图融合网络,命名为 AFN-HearNet,它通过融合跨域听力图和频谱特征,同时处理 NR 和 HLC 任务。我们提出了一种特定于听力图的编码器,将稀疏的听力图配置文件转换为深度表示,解决了融合前跨域特征的对齐问题。为了纳入 NR 和 HLC 任务之间的相互作用,我们提出了基于仿射调制的听力图融合频率-时间 Conformer,将这两个特征自适应地融合为用于语音重建的统一深度表示。此外,我们引入了语音活动检测辅助训练任务,以将语音和非语音模式隐式嵌入到统一深度表示中。我们在多个数据集上进行了全面实验,以验证每个提出模块的有效性。结果表明,AFN-HearNet 在 HASQI 和 PESQ 等关键指标上显著优于最先进的上下文融合联合模型,在性能和效率之间实现了可观的权衡。源代码和数据将发布于 https://github.com/deepnetni/AFN-HearNet。

关键词

引用

@article{arxiv.2509.07341,
  title  = {Affine Modulation-based Audiogram Fusion Network for Joint Noise Reduction and Hearing Loss Compensation},
  author = {Ye Ni and Ruiyu Liang and Xiaoshuai Hao and Jiaming Cheng and Qingyun Wang and Chengwei Huang and Cairong Zou and Wei Zhou and Weiping Ding and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2509.07341},
  year   = {2025}
}