MultiMed:基于注意力编码器-解码器的多语言医疗语音识别
计算与语言
2025-05-16 v3 声音
音频与语音处理
摘要
医疗领域的多语言自动语音识别(ASR)是语音翻译、口语理解和语音助手等各种下游应用的基础任务。该技术通过打破语言障碍实现高效沟通、缓解专业劳动力短缺并促进改善诊断和治疗(尤其是在大流行期间),从而改善患者护理。在本工作中,我们介绍了 MultiMed,这是第一个多语言医疗 ASR 数据集,以及第一批涵盖五种语言(越南语、英语、德语、法语和普通话)的从小到大的端到端医疗 ASR 模型。据我们所知,MultiMed 在所有主要基准上都是世界上最大的医疗 ASR 数据集:总时长、录音条件数量、口音数量和说话角色数量。此外,我们提出了首次针对医疗 ASR 的多语言研究,其中包括可复现的经验基线、单语-多语言分析、注意力编码器-解码器(AED)与混合模型的对比研究以及语言学分析。我们提出了针对固定可训练参数数优化的实用 ASR 端到端训练方案,这在工业界环境中很常见。所有代码、数据和模型均在线提供:https://github.com/leduckhai/MultiMed/tree/master/MultiMed。
关键词
引用
@article{arxiv.2409.14074,
title = {MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder},
author = {Khai Le-Duc and Phuc Phan and Tan-Hanh Pham and Bach Phan Tat and Minh-Huong Ngo and Chris Ngo and Thanh Nguyen-Tang and Truong-Son Hy},
journal= {arXiv preprint arXiv:2409.14074},
year = {2025}
}
备注
ACL 2025, 38 pages