USpeech:通过跨模态合成以最少人力实现超声增强语音
声音
2025-05-20 v2 人机交互
音频与语音处理
摘要
语音增强对于无处不在的人机交互至关重要。近年来,基于超声的声学感知因其卓越的普适性和性能,已成为语音增强的一个有吸引力的选择。然而,由于在音频-超声数据采集过程中不可避免地会受到来自意外和非预期源的干扰,现有解决方案严重依赖人力进行数据收集和处理。这导致了显著的数据稀缺,限制了基于超声的语音增强的全部潜力。为解决此问题,我们提出了 USpeech,一个以最少人力实现语音增强的跨模态超声合成框架。其核心是一个两阶段框架,通过利用音频作为桥梁,建立视觉与超声模态之间的对应关系。该方法克服了缺乏成对视频-超声数据集以及视频与超声数据之间固有的异质性所带来的挑战。我们的框架结合了对比式视频-音频预训练,将模态投影到共享语义空间,并采用音频-超声编码器-解码器进行超声合成。然后,我们提出了一个语音增强网络,在时频域增强语音,并通过神经声码器恢复干净的语音波形。综合实验表明,USpeech 使用合成超声数据取得了与物理数据相当的卓越性能,优于最先进的基于超声的语音增强基线。USpeech 已在 https://github.com/aiot-lab/USpeech/ 开源。
引用
@article{arxiv.2410.22076,
title = {USpeech: Ultrasound-Enhanced Speech with Minimal Human Effort via Cross-Modal Synthesis},
author = {Luca Jiang-Tao Yu and Running Zhao and Sijie Ji and Edith C. H. Ngai and Chenshu Wu},
journal= {arXiv preprint arXiv:2410.22076},
year = {2025}
}
备注
Accepted by Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies (ACM IMWUT/UbiComp 2025)