RAND:面向量化序列到序列模型的鲁棒性感知范数衰减
音频与语音处理
2023-05-26 v1 机器学习
摘要
随着神经网络规模的快速增长,模型压缩已成为重要的研究领域。量化是减小大型模型尺寸、内存访问与计算负载的有效技术。尽管量化感知训练(QAT)技术近期取得进展,多数论文的评估聚焦于计算机视觉任务,其与序列任务具有不同的训练动态。本文中,我们首先在从 1000 小时到 100 万小时的多个语音识别数据集以及一项机器翻译数据集(以说明其在语音之外的适用性)上,对直通估计器、伪量化噪声、可学习尺度参数、截断等流行技术对 4-bit 序列到序列模型的影响进行基准测试。通过实验,我们报告基于噪声的 QAT 在回流至量化尺度的正则化信号不足时性能受损。我们提出对 QAT 流程的低复杂度改动以提升模型精度(优于流行的可学习尺度与截断方法)。借助提升的精度,这开启了利用基于噪声的 QAT 其他优势的可能:1)训练在混合精度模式下表现良好的单一模型;2)在长语音识别上改进的泛化能力。
引用
@article{arxiv.2305.15536,
title = {RAND: Robustness Aware Norm Decay For Quantized Seq2seq Models},
author = {David Qiu and David Rim and Shaojin Ding and Oleg Rybakov and Yanzhang He},
journal= {arXiv preprint arXiv:2305.15536},
year = {2023}
}