面向胃肠镜人机智能协作的领域适应语音识别开发与多中心评估
计算与语言
2026-04-03 v1 人工智能
摘要
自动语音识别 (ASR) 是胃肠镜人机交互的关键接口,但其在实际临床环境中的可靠性受限于领域特定术语和复杂声学条件。本文提出EndoASR,一款为在内窥镜工作流程中实现实时部署而设计的领域适应ASR系统。我们基于合成内窥镜报告开发了两阶段适应策略,针对领域特定语言建模和噪声鲁棒性进行优化。在六位内窥镜医生的回顾性评估中,EndoASR显著性地提高了转录准确性和临床可用性,将字符错误率 (CER) 从20.52%降低至14.14%,将医学术语准确率 (Med ACC) 从54.30%提高至87.59%。在跨越五个独立内窥镜中心的前瞻性多中心研究中,EndoASR在异构真实世界条件下表现出一致的泛化能力。与基线Paraformer模型相比,CER从16.20%降低至14.97%,Med ACC从61.63%提高至84.16%,确认其在实际部署场景中的鲁棒性。值得注意的是,EndoASR实现了0.005的实时因子 (RTF),显著快于Whisper-large-v3 (RTF 0.055),且模型参数仅2.2亿,能够高效实现边缘部署。此外,与大型语言模型集成后,改进的ASR质量直接提升了下游结构化信息提取和临床医生与AI之间的交互。这些结果表明,领域适应ASR可作为胃肠镜人机智能协作可靠接口,经多中心真实世界临床环境验证其一致性能。
引用
@article{arxiv.2604.01705,
title = {Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy},
author = {Ruijie Yang and Yan Zhu and Peiyao Fu and Te Luo and Zhihua Wang and Xian Yang and Quanlin Li and Pinghong Zhou and Shuo Wang},
journal= {arXiv preprint arXiv:2604.01705},
year = {2026}
}
备注
Under review at npj Digital Medicine