针对飞行舱中多语言飞行员语音转录的 Whisper 模型分析与微调
计算与语言
2025-06-30 v1 人工智能
机器学习
音频与语音处理
摘要
基于Transformer编码器-解码器架构的开发带来了机器翻译、自动语音识别(ASR)和基于指令的聊天机器人等众多应用领域的重大突破。虽然这些预训练模型是在大规模通用数据上进行少量历元(大多数情况下不足五个历元)的训练,使其具有强大的泛化能力,但当应用于诸如飞行舱中飞行员语音转录等特定领域时,性能仍会受到影响,该领域涉及大量特定词汇和多语言交流。本文针对飞行舱对话的转录准确率进行了调查和改进。我们收集了约85分钟的飞行舱模拟录音和130分钟的飞行员采访录音,并对其进行了手动标注。说话者为中年男性,语言为德语和英语。为提高转录准确率,我们提出了多种归一化方案以细化转录结果并提高词错误率(WER)。随后我们采用微调来提升ASR性能,利用低秩适应(LoRA)实现性能高效微调。通过该方法,WER从68.49%(预训练Whisper Large模型,无归一化基准)降至26.26%(使用所提出的归一化方案微调后的Whisper Large模型)。
引用
@article{arxiv.2506.21990,
title = {Analyzing and Fine-Tuning Whisper Models for Multilingual Pilot Speech Transcription in the Cockpit},
author = {Kartheek Kumar Reddy Nareddy and Sarah Ternus and Julia Niebling},
journal= {arXiv preprint arXiv:2506.21990},
year = {2025}
}
备注
Computer Vision and Pattern Recognition (CVPR) 2025 Workshops