中文

LiteASR:基于低秩近似的高效自动语音识别

机器学习 2025-08-26 v2 人工智能 声音 音频与语音处理

摘要

现代自动语音识别(ASR)模型(如 OpenAI 的 Whisper)依赖于深度编码器-解码器架构,由于其计算强度高,其编码器是高效部署的关键瓶颈。我们引入了 LiteASR,一种针对 ASR 编码器的低秩压缩方案,可在保持转录准确性的同时显著降低推理成本。我们的方法利用了在中间激活中观察到的强低秩特性:通过使用小型校准数据集应用主成分分析(PCA),我们用一系列低秩矩阵乘法近似线性变换,并进一步优化自注意力以在降低的维度下工作。评估结果表明,我们的方法可以将 Whisper large-v3 的编码器大小压缩超过 50%,大小与 Whisper medium 相当,但具有更好的转录准确性,从而建立了准确性和效率的新 Pareto 前沿。LiteASR 的代码可在 https://github.com/efeslab/LiteASR 获取。

关键词

引用

@article{arxiv.2502.20583,
  title  = {LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation},
  author = {Keisuke Kamahori and Jungo Kasai and Noriyuki Kojima and Baris Kasikci},
  journal= {arXiv preprint arXiv:2502.20583},
  year   = {2025}
}

备注

EMNLP2025 Main