聆听声音:利用声学上下文表征的生成式语音恢复
音频与语音处理
2025-08-13 v1 声音
摘要
本文介绍了一种通过整合上下文相关条件策略进行语音恢复的新方法。具体而言,我们采用基于扩散的生成式恢复模型UNIVERSE++作为骨干网络,以评估上下文表征的有效性。我们整合了从CLAP模型中提取的声学上下文嵌入,这些嵌入捕获了输入音频的环境属性。此外,我们提出了一种声学上下文(ACX)表征,该表征对CLAP嵌入进行了精炼,以更好地处理语音信号中的各种失真因素及其强度。与依赖语言和说话人属性的基于内容的方法不同,ACX提供的上下文信息使恢复模型能够更好地区分和缓解失真。实验结果表明,上下文感知的条件化改善了恢复性能及其在不同失真条件下的稳定性,与基于内容的方法相比降低了变异性。
引用
@article{arxiv.2508.08953,
title = {Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation},
author = {Soo-Whan Chung and Min-Seok Choi},
journal= {arXiv preprint arXiv:2508.08953},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025