听力助听器中面向实时的音频-视觉特征同步语音增强
音频与语音处理
2025-08-28 v1
摘要
面向实时语音增强的音频-视觉特征同步代表了一种逐步提高语音可理解性和用户体验的方法,尤其在强噪声环境中。该方法将听觉信号与视觉线索相结合,利用这些模态的互补描述来提高语音可理解性。听力助听器中实现实时语音增强的音频-视觉特征同步可通过高效特征对齐模块进行优化。在本研究中,一个轻量级的跨注意模型通过利用大规模数据和简单架构来学习鲁棒的音频-视觉表征。通过将轻量级跨注意模型整合到 AVSE 框架中,神经系统能够动态地强调音频和视觉模态之间的关键特征,从而实现明确的同步并提高语音可理解性。所提出的 AVSE 模型不仅在噪声抑制和特征对齐方面实现高性能,还实现了实时处理,具有最小延迟 (36ms) 和低能耗。针对 AVSEC3 数据集的评估显示,该模型效率高,在感知质量 (PESQ:0.52)、可理解性 (STOI:19%) 和保真度 (SI-SDR:10.10dB) 上均显著优于基线方法。
引用
@article{arxiv.2508.19483,
title = {Audio-Visual Feature Synchronization for Robust Speech Enhancement in Hearing Aids},
author = {Nasir Saleem and Mandar Gogate and Kia Dashtipour and Adeel Hussain and Usman Anwar and Adewale Adetomi and Tughrul Arslan and Amir Hussain},
journal= {arXiv preprint arXiv:2508.19483},
year = {2025}
}
备注
Preprint of the paper presented at Euronoise 2025 Malaga, Spain