中文

ACA-Net:基于非对称交叉注意力实现轻量级说话人验证

声音 2023-05-23 v1 机器学习 音频与语音处理

摘要

本文中,我们提出 ACA-Net,一种用于说话人验证(SV)的轻量级、全局上下文感知说话人嵌入提取器,其通过使用非对称交叉注意力(ACA)替代时间池化改进了现有工作。ACA 能够通过将小的查询注意力作用于大的键和值矩阵,将大的可变长度序列提炼为小的固定尺寸隐变量。在 ACA-Net 中,我们使用 ACA 构建多层聚合(MLA)块,从可变长度输入生成固定尺寸身份向量。通过全局注意力,ACA-Net 充当高效的全局特征提取器,可适应时间变异性,不同于现有 SV 模型在时域上应用固定池化函数而可能掩盖信号非平稳时间变异性信息。我们在 WSJ0-1talker 上的实验表明,ACA-Net 仅使用 1/5 的参数便在等错误率(EER)上相对基线取得 5% 的相对提升。

关键词

引用

@article{arxiv.2305.12121,
  title  = {ACA-Net: Towards Lightweight Speaker Verification using Asymmetric Cross Attention},
  author = {Jia Qi Yip and Tuan Truong and Dianwen Ng and Chong Zhang and Yukun Ma and Trung Hieu Nguyen and Chongjia Ni and Shengkui Zhao and Eng Siong Chng and Bin Ma},
  journal= {arXiv preprint arXiv:2305.12121},
  year   = {2023}
}

备注

Accepted to INTERSPEECH 2023