语音模型训练中性能与复杂度的权衡优化
声音
2026-01-22 v2 人工智能
机器学习
音频与语音处理
摘要
在语音机器学习中,神经网络模型通常通过选择具有固定层大小和结构的架构来设计。然后训练这些模型以最大化与任务目标一致的指标上的性能。虽然整体架构通常由任务的先验知识指导,但各层的大小通常是启发式选择的。然而,这种方法并不能保证性能与计算复杂度之间的最优权衡;因此,通常采用权重量化或模型剪枝等事后方法来降低计算成本。这是因为随机梯度下降(SGD)方法只能优化可微函数,而影响计算复杂度的因素,如层大小和每秒浮点运算次数(FLOP/s),是不可微的,需要在训练期间修改模型结构。我们提出了一种基于特征噪声注入的重参数化技术,该技术能够在训练期间使用基于 SGD 的方法联合优化性能和计算复杂度。与传统的剪枝方法不同,我们的方法允许针对目标性能-复杂度权衡动态优化模型大小,而无需依赖启发式标准来选择要移除的权重或结构。我们通过三个案例研究证明了我们方法的有效性,包括一个合成示例和两个实际应用:语音活动检测和音频反欺骗。与我们的工作相关的代码已公开,以鼓励进一步的研究。
引用
@article{arxiv.2601.13704,
title = {Performance and Complexity Trade-off Optimization of Speech Models During Training},
author = {Esteban Gómez and Tom Bäckström},
journal= {arXiv preprint arXiv:2601.13704},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication