中文

任务感知的统一音源分离

音频与语音处理 2024-11-01 v1 声音

摘要

已有多种尝试旨在用单一模型处理多种音源分离任务,如语音增强、语音分离、声音事件分离、音乐音源分离(MSS)或电影音频音源分离(CASS)。这些模型在大规模数据(包括语音、乐器或声音事件)上训练,通常能成功分离广泛的音源。然而,此类模型仍难以覆盖所有分离任务,因为其中一些任务是相互矛盾的(例如,在MSS中乐器被分离,而在CASS中它们必须被归组)。为克服此问题并支持所有主要分离任务,我们提出了一种任务感知的统一音源分离(TUSS)模型。该模型使用可变数量的可学习提示来指定要分离的音源,并根据给定的提示改变其行为,使其能够处理所有主要分离任务,包括相互矛盾的任务。实验结果表明,所提出的TUSS模型成功处理了上述五种主要分离任务。我们还提供了一些音频示例,包括合成混合和真实录音,以展示TUSS模型在推理时如何根据提示灵活地改变其行为。

关键词

引用

@article{arxiv.2410.23987,
  title  = {Task-Aware Unified Source Separation},
  author = {Kohei Saijo and Janek Ebbers and François G. Germain and Gordon Wichern and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2410.23987},
  year   = {2024}
}

备注

Submitted to ICASSP 2025