中文

Au-M-ol:面向医学音频与语言理解的统一模型

计算与语言 2026-04-28 v1 人工智能

摘要

本文提出了 Au-M-ol,一种新颖的多模态架构,将语音识别(ASR)扩展至大语言模型(LLM),以提升临床相关任务的性能。Au-M-ol 包含三个主要组件:(1)从医学语音中提取丰富声学特征的音频编码器;(2)将音频特征映射到 LLM 输入空间的适配层;(3)执行转录和临床语言理解的预训练 LLM。该设计使模型能够直接解释 spoken medical content,提高准确率和鲁棒性。在实验中,Au-M-ol 在医学转录任务中将词错误率(WER)降低了 56%。该模型在噪声环境、专业术语和说话人差异性等挑战条件下表现良好。这些结果表明,Au-M-ol 是临床应用中可靠且上下文感知的音频理解系统的强有力候选人。

关键词

引用

@article{arxiv.2604.23284,
  title  = {Au-M-ol: A Unified Model for Medical Audio and Language Understanding},
  author = {Meizhu Liu and Nistha Mitra and Paul Li and Amine Abdaoui and Adam Ledyard and Tao Sheng},
  journal= {arXiv preprint arXiv:2604.23284},
  year   = {2026}
}