从脉冲到语音:NeuroVoc——一种用于听觉感知和人工耳蜗仿真的生物合理声码器框架
声音
2025-06-05 v1 音频与语音处理
神经元与认知
摘要
我们提出了NeuroVoc,一个灵活的模型无关声码器框架,通过逆傅里叶变换从模拟神经活动模式重建声学波形。该系统对神经图表示应用简单的信号处理,即听觉神经纤维模型的时间-频率分箱输出。关键的是,模型架构是模块化的,允许底层听觉模型的轻松替换或修改。这种灵活性消除了在模拟人工耳蜗(CI)用户听觉感知时需要特定语音编码策略的声码器实现。它还允许在正常听力(NH)模型和电听觉(EH)模型之间进行直接比较,正如本研究中所展示的。该声码器保留了每个模型的特征;例如,NH模型比EH模型更忠实地保留了谐波结构。我们使用在线噪声中数字(Digits-in-Noise, DIN)测试评估了噪声中的感知可懂度,参与者完成了三个测试条件:标准语音,以及使用NH模型和EH模型进行声码器处理的语音。标准DIN测试和EH声码器组在统计上与NH和CI听者的临床报告数据等效。平均而言,NH和EH声码器组相比标准测试分别将信噪比(SRT)提高了2.4 dB和7.1 dB。这些结果表明,尽管存在一定退化,声码器能够在两种听力模型下重建可懂语音,并准确反映CI用户在噪声中语音感知能力的下降。
引用
@article{arxiv.2506.03959,
title = {From Spikes to Speech: NeuroVoc -- A Biologically Plausible Vocoder Framework for Auditory Perception and Cochlear Implant Simulation},
author = {Jacob de Nobel and Jeroen J. Briaire and Thomas H. W. Baeck and Anna V. Kononova and Johan H. M. Frijns},
journal= {arXiv preprint arXiv:2506.03959},
year = {2025}
}
备注
43 Pages, 11 Figures, 2 Tables