时域中稀疏重叠语音训练:目标语音分离与个人 VAD 联合学习的收益
声音
2021-09-28 v2 计算与语言
音频与语音处理
摘要
目标语音分离是根据提供的额外说话人身份信息,从语音混合中滤出某特定说话人声音的过程。近期工作通过直接在时域处理信号取得了可观改进。其中多数采用完全重叠的语音混合进行训练。然而,由于大多数真实对话随机发生且为稀疏重叠,我们认为以不同重叠比例数据训练有益。为此,一个不可避免的问题是广泛使用的 SI-SNR 损失对静音源无定义。本文提出加权 SI-SNR 损失,并联合学习目标语音分离与个人 VAD。加权 SI-SNR 损失施加一个正比于目标说话人时长的权重因子,并在目标说话人缺席时返回零。同时,个人 VAD 生成掩码并将非目标语音置为静音。实验表明,所提方法在完全重叠语音上以 SDR 计优于基线 1.73 dB,在干净与噪声条件下的稀疏重叠语音上分别优于 4.17 dB 与 0.9 dB。此外,在性能略有下降的情况下,我们的模型可减少推理的时间开销。
引用
@article{arxiv.2106.14371,
title = {Sparsely Overlapped Speech Training in the Time Domain: Joint Learning of Target Speech Separation and Personal VAD Benefits},
author = {Qingjian Lin and Lin Yang and Xuyang Wang and Luyuan Xie and Chen Jia and Junjie Wang},
journal= {arXiv preprint arXiv:2106.14371},
year = {2021}
}
备注
Accepted by APSIPA 2021