用于说话人分离的个性化条件建模与负距离
声音
2022-10-13 v1 人工智能
音频与语音处理
摘要
说话人分离旨在从混合信号中提取多个语音。本文中,我们提出两种感知说话人的设计来改进现有的说话人分离方案。第一个模型是一个说话人条件网络,它整合语音样本以生成个性化的说话人条件,进而为分离模块提供有信息的引导以产生良好分离的输出。第二个设计旨在减少分离语音中的非目标声音。为此,我们提出负距离来惩罚通道输出中任何非目标声音的出现,并提出正距离来使分离出的语音更接近干净目标。我们探索了加权求和与类三元组两种不同设置,将这两种距离整合以形成分离网络的联合辅助损失。在 LibriMix 上进行的实验证明了我们所提模型的有效性。
引用
@article{arxiv.2210.06368,
title = {Individualized Conditioning and Negative Distances for Speaker Separation},
author = {Tao Sun and Nidal Abuhajar and Shuyu Gong and Zhewei Wang and Charles D. Smith and Xianhui Wang and Li Xu and Jundong Liu},
journal= {arXiv preprint arXiv:2210.06368},
year = {2022}
}
备注
Accepted to ICMLA 2022