提升达罗毗荼语系医疗领域的 ASR 性能
音频与语音处理
2026-04-23 v1 人工智能
计算与语言
摘要
由于标注数据有限且形态复杂,泰卢固语和卡纳达语等低资源达罗毗荼语系语言在专业医疗领域面临自动语音识别(ASR)的重大挑战。本工作提出了一种新颖的置信度感知训练框架,该框架通过混合置信度机制整合真实与合成语音数据,该机制将静态感知与声学相似度指标与动态模型熵相结合。与直接微调方法不同,所提出的方法采用固定权重和可学习权重的置信度聚合策略来指导训练期间的样本加权,从而实现对异构数据源的有效利用。该框架在包含真实录音和 TTS 生成的合成语音的泰卢固语和卡纳达语医疗数据集上进行了评估。应用 5-gram KenLM 语言模型进行解码后校正。结果表明,具有可学习权重的混合置信度感知方法显著降低了识别错误:泰卢固语词错率(WER)从 24.3% 降至 15.8%(绝对提升 8.5%),而卡纳达语 WER 从 31.7% 降至 25.4%(绝对提升 6.3%),两者均显著优于标准微调基线。这些发现证实,将自适应置信度感知训练与统计语言建模相结合,可为形态复杂的达罗毗荼语系中特定领域的 ASR 提供卓越的性能。
引用
@article{arxiv.2604.19797,
title = {Enhancing ASR Performance in the Medical Domain for Dravidian Languages},
author = {Sri Charan Devarakonda and Ravi Sastry Kolluru and Manjula Sri Rayudu and Rashmi Kapoor and Madhu G and Anil Kumar Vuppala},
journal= {arXiv preprint arXiv:2604.19797},
year = {2026}
}