Conditioned-U-Net:在U-Net中引入用于控制多种音源分离的控制机制
音频与语音处理
2019-11-22 v3 机器学习
声音
摘要
用于音频源分离的数据驱动模型(如U-Net或Wave-U-Net)通常是专用于并针对单一任务(例如特定乐器隔离)专门训练的模型。将它们同时训练用于多种任务通常会导致比单一专门任务训练更差的性能。在本工作中,我们引入了Conditioned-U-Net(C-U-Net),其在标准U-Net上添加了控制机制。该控制机制使我们能够训练一个唯一且通用的U-Net来执行多种乐器的分离。C-U-Net根据one-hot编码输入向量决定要隔离的乐器。输入向量被嵌入以获得控制特征线性调制(FiLM)层的参数。FiLM层通过仿射变换修改U-Net特征图以分离所需乐器。C-U-Net以单一模型执行不同的乐器分离,达到与专用模型相同的性能且成本更低。
引用
@article{arxiv.1907.01277,
title = {Conditioned-U-Net: Introducing a Control Mechanism in the U-Net for Multiple Source Separations},
author = {Gabriel Meseguer-Brocal and Geoffroy Peeters},
journal= {arXiv preprint arXiv:1907.01277},
year = {2019}
}