中文

面向说话人验证的深度说话人嵌入学习的内存高效训练

音频与语音处理 2024-12-03 v1 人工智能 声音

摘要

近期的说话人验证(SV)系统呈现出采用更深层说话人嵌入提取器的趋势。虽然更深更大的神经网络可显著提升性能,但其巨大的内存需求阻碍了在消费级 GPU 上进行训练。本文探索了在资源受限场景下进行深度说话人嵌入学习的内存高效训练策略。首先,我们对 GPU 在 SV 系统训练期间的内存分配进行了系统分析。经验观察表明,激活值和优化器状态是主要的内存消耗来源。对于激活值,我们设计了两种可逆神经网络,这些网络在反向传播期间无需存储中间激活值,从而在不牺牲性能的前提下显著降低了内存使用。对于优化器状态,我们引入了一种动态量化方法,将原始的32位浮点值替换为基于动态树的8位数据类型。在 VoxCeleb 数据集上的实验结果表明,可逆版本的 ResNet 和 DF-ResNet 可以在训练期间无需在 GPU 内存中缓存激活值。此外,8位版本的 SGD 和 Adam 可在保持与32位版本相似性能的同时节省75%的内存开销。最后,关于内存使用和性能的详细比较表明,我们提出的模型在几乎保持与基础系统相同的参数数量和性能的同时,可实现最高16.2倍的内存节省。与以往需要多个高端 GPU(如 A100)不同,我们仅需一个或两个消费级 2080Ti GPU 即可有效训练深度说话人嵌入提取器。

关键词

引用

@article{arxiv.2412.01195,
  title  = {Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification},
  author = {Bei Liu and Yanmin Qian},
  journal= {arXiv preprint arXiv:2412.01195},
  year   = {2024}
}

备注

Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing