中文

面向目标源分离的最优条件训练

声音 2022-11-14 v1 机器学习 音频与语音处理

摘要

近期研究表明,利用多个无关且非互斥的语义概念进行声源分离取得了卓越性能,可基于多种不同查询灵活提取给定目标源。本文提出一种用于单通道目标源分离的新最优条件训练 (OCT) 方法,该方法基于使用与给定目标源等效的条件中性能最高的条件进行贪婪参数更新。我们的实验表明,与单条件模型相比,多样语义概念所携带的互补信息显著有助于更高效地对感兴趣源进行解缠与隔离。此外,我们提出带条件精炼的 OCT 变体,其中初始条件向量被适配于给定混合信号并转换为更利于目标源提取的表示。我们在多样源分离实验中展示了 OCT 的有效性,其优于具有 oracle 分配的置换不变模型,并在更具挑战性的基于文本的源分离任务中取得最先进 (SOTA) 性能,甚至超越专用的纯文本条件模型。

关键词

引用

@article{arxiv.2211.05927,
  title  = {Optimal Condition Training for Target Source Separation},
  author = {Efthymios Tzinis and Gordon Wichern and Paris Smaragdis and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2211.05927},
  year   = {2022}
}

备注

Submitted to ICASSP 2023