桥接音频、视觉与语言多模态间隙距用于语音增强
声音
2025-05-27 v2 机器学习
多媒体
音频与语音处理
摘要
语音增强 (SE) 旨在提高噪声环境中语音的质量和可理解性。最近的研究表明, 将视觉线索纳入音频信号处理可提高SE性能。鉴于人类语音交流自然地涉及音频、视觉和语言多模态, 合理预期通过整合语言信息可进一步提升性能。然而, 在知识迁移过程中有效地桥接这些模态间隙距仍是一个重大挑战。本文提出了一种新型多模态学习框架, 称为DLAV-SE, 它利用基于扩散的模型整合音频、视觉和语言信息用于音频-视觉语音增强 (AVSE)。在该框架中, 语言模态使用预训练语言模型 (PLM) 实现, 通过跨模态知识迁移 (CMKT) 机制在训练期间将语言知识传递到音频-视觉领域。训练完成后, 无需在推理阶段使用PLM, 因为其知识通过CMKT过程嵌入到AVSE模型中。我们进行一系列SE实验以评估该方法的有效性。结果表明, 所提出的DLAV-SE系统在语音质量方面显著优于当前最先进 (SOTA) 方法, 并显著降低生成性伪影, 如音素混淆。此外, 可视化分析确认CMKT方法提高了AVSE输出的生成质量。这些发现凸显了基于扩散的方法在推进AVSE方面的潜力, 以及纳入语言信息以进一步提升系统性能的价值。
引用
@article{arxiv.2501.13375,
title = {Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement},
author = {Meng-Ping Lin and Jen-Cheng Hou and Chia-Wei Chen and Shao-Yi Chien and Jun-Cheng Chen and Xugang Lu and Yu Tsao},
journal= {arXiv preprint arXiv:2501.13375},
year = {2025}
}