基于角度空间类感知注意力对比学习的判别性说话人表征
音频与语音处理
2023-03-14 v3 声音
摘要
将对比学习应用于说话人验证(Speaker Verification, SV)的挑战在于:基于 softmax 的对比损失缺乏判别力,且困难负样本对容易影响学习。为克服第一个挑战,我们提出了一种对比学习 SV 框架,将加性角度间隔(additive angular margin)引入监督对比损失中,该间隔提升了说话人表征的判别能力。针对第二个挑战,我们引入了类感知注意力机制,使困难负样本对监督对比损失的贡献显著降低。我们还采用基于梯度的多目标优化来平衡分类损失与对比损失。在 CN-Celeb 和 Voxceleb1 上的实验结果表明,这一新学习目标能使编码器找到一个跨语言具有优异说话人判别性的嵌入空间。
引用
@article{arxiv.2210.16622,
title = {Discriminative Speaker Representation via Contrastive Learning with Class-Aware Attention in Angular Space},
author = {Zhe Li and Man-Wai Mak and Helen Mei-Ling Meng},
journal= {arXiv preprint arXiv:2210.16622},
year = {2023}
}
备注
Accepted by ICASSP 2023, 5 pages, 2 figures