中文

LLaSE-G1:激励LLaMA基语音增强的泛化能力

音频与语音处理 2025-06-11 v4 人工智能 计算与语言 声音

摘要

近期语言模型(LM)的进展显示出在语义理解和上下文建模方面的强大能力,这些能力在生成式语音增强(SE)中得到了丰厚的体现。然而,许多基于LM的SE方法主要关注语义信息,往往忽视了声学信息的关键作用,这导致增强后的声学不一致性以及在 diverse SE任务上的有限泛化能力。在本文中,我们引入LLaSE-G1,一个激励语音增强泛化能力的LLaMA基语言模型。LLaSE-G1的主要贡献包括:首先,为缓解声学不一致性,LLaSE-G1采用WavLM作为输入的连续表示,并预测X-Codec2的语音标记,最大化声学保留。其次,为促进泛化能力,LLaSE-G1引入双通道输入和输出,统一多个SE任务,而无需任务特定ID。此外,LLaSE-G1超过了先前的任务特定判别式和生成式SE模型,展示了测试时的扩展效应以及对未见SE任务的新兴能力。此外,我们发布了代码和模型以支持该领域的进一步研究。

关键词

引用

@article{arxiv.2503.00493,
  title  = {LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement},
  author = {Boyi Kang and Xinfa Zhu and Zihan Zhang and Zhen Ye and Mingshuai Liu and Ziqian Wang and Yike Zhu and Guobin Ma and Jun Chen and Longshuai Xiao and Chao Weng and Wei Xue and Lei Xie},
  journal= {arXiv preprint arXiv:2503.00493},
  year   = {2025}
}

备注

ACL2025 main, Codes available at https://github.com/Kevin-naticl/LLaSE-G1