LiteASR:基于低秩近似的高效自动语音识别
机器学习
2025-08-26 v2 人工智能
声音
音频与语音处理
摘要
现代自动语音识别(ASR)模型(如 OpenAI 的 Whisper)依赖于深度编码器-解码器架构,由于其计算强度高,其编码器是高效部署的关键瓶颈。我们引入了 LiteASR,一种针对 ASR 编码器的低秩压缩方案,可在保持转录准确性的同时显著降低推理成本。我们的方法利用了在中间激活中观察到的强低秩特性:通过使用小型校准数据集应用主成分分析(PCA),我们用一系列低秩矩阵乘法近似线性变换,并进一步优化自注意力以在降低的维度下工作。评估结果表明,我们的方法可以将 Whisper large-v3 的编码器大小压缩超过 50%,大小与 Whisper medium 相当,但具有更好的转录准确性,从而建立了准确性和效率的新 Pareto 前沿。LiteASR 的代码可在 https://github.com/efeslab/LiteASR 获取。
引用
@article{arxiv.2502.20583,
title = {LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation},
author = {Keisuke Kamahori and Jungo Kasai and Noriyuki Kojima and Baris Kasikci},
journal= {arXiv preprint arXiv:2502.20583},
year = {2025}
}
备注
EMNLP2025 Main