迈向统一Conformer结构:从ASR到ASV任务
音频与语音处理
2023-01-18 v2 声音
摘要
Transformer凭借其强大的自注意力机制在自然语言处理与计算机视觉任务中取得了卓越性能,其变体Conformer已成为自动语音识别(ASR)领域的先进架构。然而,自动说话人确认(ASV)的主流架构为卷积神经网络,基于Conformer的ASV研究仍有很大空间。本文中,我们首先以极小的改动将Conformer架构从ASR改造用于ASV。采用长度缩放注意力(LSA)方法与锐度感知最小化(SAM)以提升模型泛化性。在VoxCeleb与CN-Celeb上的实验表明,我们基于Conformer的ASV取得了与流行ECAPA-TDNN相竞争的性能。其次,受迁移学习策略启发,ASV Conformer可自然地从预训练ASR模型初始化。通过参数迁移,自注意力机制能更好地聚焦于序列特征间的关系,在VoxCeleb与CN-Celeb测试集上带来约11%的EER相对提升,揭示了Conformer统一ASV与ASR任务的潜力。最后,我们在ASV-Subtools中提供了运行时以评估其在生产场景中的推理速度。我们的代码发布于https://github.com/Snowdar/asv-subtools/tree/master/doc/papers/conformer.md。
引用
@article{arxiv.2211.07201,
title = {Towards A Unified Conformer Structure: from ASR to ASV Task},
author = {Dexin Liao and Tao Jiang and Feng Wang and Lin Li and Qingyang Hong},
journal= {arXiv preprint arXiv:2211.07201},
year = {2023}
}