中文

SA-SDR:一种用于会议风格数据分离的新的损失函数

音频与语音处理 2022-04-22 v2 声音

摘要

许多最先进的基于神经网络的源分离系统使用平均信噪比失真比(SDR)作为训练目标函数。然而,当网络完美重构参考信号,或参考信号包含静音时(例如,当一个双输出分离器处理单说话人录音时),基本 SDR 是未定义的。已有许多对普通 SDR 的改进,在使损失更鲁棒与其值失真之间进行权衡。我们提出从对每个单独输出通道的 SDR 取均值,转为同时对全部输出通道计算全局 SDR,称之为源聚合 SDR(SA-SDR)。只要至少一个参考信号非静音,该损失对静音与完美重构均是鲁棒的。我们通过实验表明,在处理通常含有大量静音或单说话人区域的会议风格数据时,所提 SA-SDR 比其他知名改进更稳定且更可取。

关键词

引用

@article{arxiv.2110.15581,
  title  = {SA-SDR: A novel loss function for separation of meeting style data},
  author = {Thilo von Neumann and Keisuke Kinoshita and Christoph Boeddeker and Marc Delcroix and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2110.15581},
  year   = {2022}
}

备注

accepted at ICASSP 2022