通过具有最大说话人可分性的对比损失进行说话人表征学习
音频与语音处理
2022-11-18 v3 声音
摘要
在使用深度模型进行说话人表征学习时,一个巨大挑战是设计能够在未知领域下增强未见说话人判别性的学习目标。本工作提出一种有监督对比学习目标,通过有效利用训练数据中的标签信息来学习说话人嵌入空间。在该空间中,同一或相似说话人所说的语句对将彼此靠近,而不同说话人所说的语句对将相距遥远。对于每个训练说话人,我们对其语句进行随机数据增强以构成正对,来自不同说话人的语句构成负对。为了在嵌入空间中最大化说话人可分性,我们将加性角间隔损失融入对比学习目标。在 CN-Celeb 上的实验结果表明,这一新学习目标能使 ECAPA-TDNN 找到一个展现出优异说话人判别性的嵌入空间。该对比学习目标易于实现,我们在 https://github.com/shanmon110/AAMSupCon 提供了 PyTorch 代码。
引用
@article{arxiv.2210.16636,
title = {Speaker Representation Learning via Contrastive Loss with Maximal Speaker Separability},
author = {Zhe Li and Man-Wai Mak},
journal= {arXiv preprint arXiv:2210.16636},
year = {2022}
}
备注
Accept by APSIPA ASC 2022, 6 pages, 2 figures