中文

基于资源高效微调方法的方言识别

计算与语言 2025-12-03 v1 声音

摘要

方言识别(DI)是识别同一语言中不同方言的任务,从语音信号中实现。DI 可以帮助即使在说话者拥有强烈方言的情况下,提高下游语音相关任务的表现。然而,针对诸如 DI 之类的任务对预训练语音模型进行微调在计算成本和内存要求方面存在较大挑战。近期研究探索了使用参数高效微调(PEFT)方法对预训练语音模型进行微调,以完成诸如 DI 之类的任务,这些方法在参数效率方面提供了优势,但在内存效率和训练速度方面的改进有限。为此,我们探索了最初用于语言处理的内存高效微调(MEFT)方法,并将其应用于通用预训练语音模型。我们全面分析了各种 MEFT 方法的 GPU 内存使用情况和微调速度。作为案例研究,我们对 Whisper 模型进行微调,以识别来自 KeSpeech 数据集的六个普通话亚方言,通过各种 MEFT 方法将 GPU 内存使用降低最高可达 73.25%,训练速度提升约 2.1 倍,同时保持与 vanilla 微调和 PEFT 方法相当的准确率。

关键词

引用

@article{arxiv.2512.02074,
  title  = {Dialect Identification Using Resource-Efficient Fine-Tuning Approaches},
  author = {Zirui Lin and Haris Gulzar and Monnika Roslianna Busto and Akiko Masaki and Takeharu Eda and Kazuhiro Nakadai},
  journal= {arXiv preprint arXiv:2512.02074},
  year   = {2025}
}

备注

Published in APSIPA ASC 2025