中文

基于对比嵌入回放的说话人动态识别用于同意管理

声音 2024-10-28 v2 机器学习 音频与语音处理

摘要

语音助手会无意中听到对话,因此需要一种同意管理机制。同意管理可以通过说话人识别来实现。未给予同意的用户注册其声音,之后所有关于他们的录音都将被丢弃。构建基于说话人识别的同意管理系统具有挑战性,因为必须高效地处理说话人的动态注册、移除和重新注册。本文提出了一种应对上述挑战的同意管理系统。我们应用基于对比学习的训练方法来学习底层的说话人等变性归纳偏置。针对说话人桶的对比特征在每次迭代中训练几步,并充当回放缓冲区。这些特征通过一个多步长随机采样器逐步选择用于分类。此外,还提出了利用部分旧语音进行动态注册、移除和重新注册说话人的新方法。结果验证了所提方法的内存效率和动态能力,并优于文献中的现有方法。

关键词

引用

@article{arxiv.2205.08459,
  title  = {Dynamic Recognition of Speakers for Consent Management by Contrastive Embedding Replay},
  author = {Arash Shahmansoori and Utz Roedig},
  journal= {arXiv preprint arXiv:2205.08459},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication. The current version includes 36 pages, 8 figures, and 3 tables