DBMIF:用于空气导向和骨导向语音增强的深度平衡多模态迭代融合框架
音频与语音处理
2026-03-04 v1
摘要
在信噪比(SNR)极低的环境中,传统语音增强系统的性能会急剧下降,空气导向(AC)麦克风常被环境噪声淹没。虽然骨导向(BC)传感器提供补充且对噪声鲁棒的信息,但现有融合方法难以在宽广的 SNR 条件下保持一致性能。为此,我们提出深度平衡多模态迭代融合框架(DBMIF),一个三分支架构旨�通过严格的跨模态交互来重建高保真语音。具体而言,基于多尺度交互式编码器-解码器主干,框架组织了一个迭代注意力模块和跨分支门控模块,以促进自适应加权和双向交换。为此动态交互,我们进一步集成了平衡交互瓶颈,以学习紧凑且稳定的融合表示。大量实验表明,DBMIF 在语音质量和可理解性方面在多样化噪声类型下与最新单模态和多模态基线线相当。在下游语音识别任务中,所提方法至少将字符错误率降低 2.5 个百分点。这些结果表明,DBMIF 有效地利用了 BC 语音的鲁棒性,同时保留了 AC 语音的自然性,在实际场景中确保了可靠性。源代码已公开于 github.com/wyl516w/dbmif。
引用
@article{arxiv.2603.02877,
title = {DBMIF: a deep balanced multimodal iterative fusion framework for air- and bone-conduction speech enhancement},
author = {Yilei Wu and Changyan Zheng and Xingyu Zhang and Yakun Zhang and Chengshi Zheng and Shuang Yang and Ye Yan and Erwei Yin},
journal= {arXiv preprint arXiv:2603.02877},
year = {2026}
}
备注
10 pages, 7 figures, Applied Intelligence