中文

用于文本无关说话人确认的面具代理损失

声音 2021-09-07 v2 计算与语言 音频与语音处理

摘要

开集说话人识别可视为一个度量学习问题,即最大化类间方差并最小化类内方差。有监督度量学习可分为基于实体的学习与基于代理的学习。大多数现有的度量学习目标如对比损失、三元组损失、原型损失、GE2E等均属于前者,其性能要么高度依赖于样本挖掘策略,要么受限于小批量中标签信息不足。基于代理的损失缓解了这两个缺点,然而实体间的细粒度关联要么未被利用,要么被间接利用。本文提出一种面具代理(Masked Proxy, MP)损失,直接结合了基于代理的关系与基于成对的关系。我们进一步提出多项面具代理(Multinomial Masked Proxy, MMP)损失以利用说话人对的困难度。这些方法已应用于VoxCeleb测试集评估,并达到了最先进的等错误率(EER)。

关键词

引用

@article{arxiv.2011.04491,
  title  = {Masked Proxy Loss For Text-Independent Speaker Verification},
  author = {Jiachen Lian and Aiswarya Vinod Kumar and Hira Dhamyal and Bhiksha Raj and Rita Singh},
  journal= {arXiv preprint arXiv:2011.04491},
  year   = {2021}
}

备注

Accepted at Interspeech 2021