中文

基于骨导引导的条件扩散模型多模态语音增强

音频与语音处理 2026-01-21 v1 机器学习 声音

摘要

单通道语音增强模型在极端噪声环境下性能会显著下降。虽然先前的研究表明,互补的骨导语音可以指导增强,但如何有效整合这种抗噪模态仍然是一个挑战。本文介绍了一种新颖的多模态语音增强框架,该框架使用条件扩散模型将骨导传感器与气导麦克风集成在一起。我们提出的模型在广泛的声学条件下,其性能显著优于先前建立的多模态技术和强大的基于扩散的单模态基线。

关键词

引用

@article{arxiv.2601.12354,
  title  = {Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models},
  author = {Sina Khanagha and Bunlong Lay and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2601.12354},
  year   = {2026}
}

备注

Accepted to IEEE ICASSP 2026