中文

OpenSep:利用大语言模型与文本反演进行开放世界音频分离

声音 2024-10-01 v1 人工智能 音频与语音处理

摘要

现实场景中的音频分离,其混合物包含可变数量的源,由于现有模型的局限性(如过度分离、分离不足以及对预定义训练源的依赖),带来了重大挑战。我们提出了 OpenSep,这是一个新颖的框架,它利用大语言模型(LLM)进行自动音频分离,消除了人工干预的需要并克服了源限制。OpenSep 使用文本反演,通过现成的音频描述模型从音频混合物中生成描述,从而有效解析存在的声源。随后,它采用少样本 LLM 提示来提取每个解析源的详细音频属性,促进在未见混合物中的分离。此外,我们引入了 mix-and-separate 训练框架的多级扩展,通过同时分离单源声音和混合物来增强模态对齐。大量实验表明,OpenSep 在精确分离具有挑战性的混合物中新的、未见的和可变的源方面具有优越性,优于 SOTA 基线方法。代码发布于 https://github.com/tanvir-utexas/OpenSep.git

关键词

引用

@article{arxiv.2409.19270,
  title  = {OpenSep: Leveraging Large Language Models with Textual Inversion for Open World Audio Separation},
  author = {Tanvir Mahmud and Diana Marculescu},
  journal= {arXiv preprint arXiv:2409.19270},
  year   = {2024}
}

备注

Accepted in EMNLP 2024 Main