轻量级 Wasserstein 音视模型用于统一语音增强与分离
计算机视觉与模式识别
2025-12-09 v1 音频与语音处理
摘要
语音增强 (Speech Enhancement, SE) 和语音分离 (Speech Separation, SS) 传统上被视为语音处理中的两个独立任务。然而,现实世界的音频常常同时包含背景噪声和重叠说话人,这促使需要统一解决方案。虽然最近的研究方法尝试在多阶段架构中集成 SE 和 SS,但这些方法通常涉及复杂的、参数密集的模型,并依赖监督训练,限制了可扩展性和泛化能力。本文提出了 UniVoiceLite,一个轻量级且无监督的音视框架,统一 SE 和 SS。UniVoiceLite 利用唇部运动和面部身份线索指导语音提取,并采用 Wasserstein 距离正则化在不要求配对噪声-干净数据的情况下稳定潜在空间。实验结果表明,UniVoiceLite 在噪声和多说话人场景中均取得优异性能,兼具效率和鲁健的泛化。源码可在 https://github.com/jisoo-o/UniVoiceLite 查看。
引用
@article{arxiv.2512.06689,
title = {Lightweight Wasserstein Audio-Visual Model for Unified Speech Enhancement and Separation},
author = {Jisoo Park and Seonghak Lee and Guisik Kim and Taewoo Kim and Junseok Kwon},
journal= {arXiv preprint arXiv:2512.06689},
year = {2025}
}
备注
Accepted to ASRU 2025