中文

SepALM:音频语言模型作为鲁棒语音分离的纠错器

声音 2025-05-27 v2 计算与语言 音频与语音处理

摘要

尽管当代语音分离技术能够熟练处理长时混合音频波形,但它们常常受到现实世界环境复杂性的挑战,包括嘈杂和混响环境,这可能导致分离出的语音出现伪影或失真。为了克服这些限制,我们引入了SepALM,这是一种开创性的方法,它利用音频语言模型(ALM)在初步分离后,在文本域内纠正和重新合成语音。SepALM包含四个核心组件:一个分离器、一个纠正器、一个合成器和一个对齐器。通过集成基于ALM的端到端纠错机制,我们降低了错误累积的风险,并规避了将自动语音识别(ASR)与大语言模型(LLM)融合的传统方法中通常遇到的优化障碍。此外,我们还开发了思维链(CoT)提示和知识蒸馏技术,以促进ALM的推理和训练过程。我们的实验证实,SepALM不仅提升了语音分离的精度,而且显著增强了在新颖声学环境中的适应性。

关键词

引用

@article{arxiv.2505.03273,
  title  = {SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation},
  author = {Zhaoxi Mu and Xinyu Yang and Gang Wang},
  journal= {arXiv preprint arXiv:2505.03273},
  year   = {2025}
}

备注

Appears in IJCAI 2025