StuPASE:面向低幻觉工作室级生成语音增强
音频与语音处理
2026-03-11 v1
摘要
在生成式语音增强 (SE) 中实现高感知质量且不产生幻觉仍是挑战。代表性方法 PASE 鲁棒性强但在恶劣条件下感知质量有限。我们提出 StuPASE,基于 PASE 构建以实现工作室级质量,同时保留其低幻觉特性。首先,我们展示用干燥目标进行微调(而非包含仿真早期反射的目标)可显著改善脱回声效果。其次,为解决强添加噪声下的性能限制,将 PASE 中的基于 GAN 的生成模块替换为流匹配模块,实现即使在极端恶劣条件下也能达到工作室级生成质量。实验表明,StuPASE 在保持低幻觉的同时持续产生感知高度的语音质量,超越当前最先进的 SE 方法。音频演示已提供:https://xiaobin-rong.github.io/stupase_demo/。
引用
@article{arxiv.2603.09234,
title = {StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement},
author = {Xiaobin Rong and Jun Gao and Zheng Wang and Mansur Yesilbursa and Kamil Wojcicki and Jing Lu},
journal= {arXiv preprint arXiv:2603.09234},
year = {2026}
}
备注
Submitted to Interspeech 2026