中文

用于改进说话人验证的对比混合增强学习

音频与语音处理 2022-07-13 v1 机器学习 声音

摘要

本文提出一种结合 mixup 的原型损失新形式用于说话人验证。Mixup 是一种简单而高效的数据增强技术,其为深度神经网络训练构造随机数据点及标签对的加权组合。Mixup 因能提升深度神经网络的鲁棒性与泛化能力而受到越来越多的关注。尽管 mixup 在多个领域取得成功,多数应用集中于闭集分类任务。本文中,我们提出 contrastive-mixup,一种基于距离度量学习判别表示的新增强策略。训练期间,mixup 操作生成输入与虚拟标签的凸插值。此外,我们重构了原型损失函数,使 mixup 可用于度量学习目标。为展示其在有限训练数据下的泛化性,我们通过在 VoxCeleb 数据库中改变每说话人可用语句数进行实验。实验结果表明,应用 contrastive-mixup 优于现有基线,相对降低错误率 16%,尤其在每说话人训练语句数有限时。

关键词

引用

@article{arxiv.2202.10672,
  title  = {Contrastive-mixup learning for improved speaker verification},
  author = {Xin Zhang and Minho Jin and Roger Cheng and Ruirui Li and Eunjung Han and Andreas Stolcke},
  journal= {arXiv preprint arXiv:2202.10672},
  year   = {2022}
}