UniSep:基于大规模语言模型的通用目标音频分离
声音
2025-04-01 v1 音频与语音处理
摘要
我们提出 Universal target audio Separation (UniSep),解决不同类型音频混合信号的分离任务。与前述研究不同,UniSep 在无限源域和无限源数量上进行分离。我们将分离任务建模为序列到序列问题,使用大语言模型 (LLM) 在离散潜在空间中建模音频序列,利用 LLM 处理大规模数据的混合音频能力。此外,我们提出一种新颖的预训练策略,用于利用仅音频数据,减少大规模数据模拟的工作量,并增强 LLM 对音频序列内部信息一致性和相关性的理解能力。我们还展示了在音频分离任务中扩大数据集的有效性:我们使用大规模数据 (36.5k 小时),包括语音、音乐和环境声,以训练一个通用目标音频分离模型,不局限于特定领域。实验表明,UniSep 在主观和客观评估方面达到与单一任务模型相当的成绩。
引用
@article{arxiv.2503.23762,
title = {UniSep: Universal Target Audio Separation with Language Models at Scale},
author = {Yuanyuan Wang and Hangting Chen and Dongchao Yang and Weiqin Li and Dan Luo and Guangzhi Li and Shan Yang and Zhiyong Wu and Helen Meng and Xixin Wu},
journal= {arXiv preprint arXiv:2503.23762},
year = {2025}
}
备注
Accepted by ICME 2025