中文

Marco-ASR:面向领域适应的大规模语音识别模型细调的原则化且度量驱动框架

声音 2025-12-30 v1

摘要

自动语音识别(ASR)模型在通用场景下取得了显著的准确率,但在领域特定应用中常因数据不匹配和语言多样性导致性能下降。对于基于大型语言模型(LLM)的 ASR 系统而言,这一挑战更为突出,因为其规模庞大且训练动态复杂,使得有效细调变得非平凡。为此,本文提出了一种针对传统和 LLM-based ASR 模型进行领域适应的原则化且度量驱动的细调框架。该框架强调基于性能指标的学习率优化,结合领域特定的数据转换与增强。我们在多个主流模型(包括 Whisper、Whisper-Turbo 和 Qwen2-Audio)上,通过多领域、多语言和多长度数据集进行了实证评估。我们的结果不仅验证了该框架的有效性,也为在提升领域特定 ASR 性能的同时防止过拟合建立了实用规范。

关键词

引用

@article{arxiv.2512.22165,
  title  = {Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation},
  author = {Xuanfan Ni and Fei Yang and Fengping Tian and Qingjuan Li and Chenyang Lyu and Yichao Du and Longyue Wang and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2512.22165},
  year   = {2025}
}

备注

Technical Report