中文

WER 完全不了解:评估 ASR 错误如何扭曲面向患者的临床对话中的临床理解

计算与语言 2026-01-21 v3 人工智能

摘要

随着自动语音识别(ASR)在临床对话中日益广泛部署,标准评估仍严重依赖词错误率(WER)。本文挑战了这一标准,探讨WER或其他常见指标是否与转录错误的临床影响相关。我们通过让专家临床医生比较真实语料与其ASR生成版本,标注任何差异的临床影响,构建了黄金标准基准,涉及两个不同的医生-患者对话数据集。我们的分析表明,WER和一系列现有指标与临床医生指定的风险标签(无、最低或显著影响)之间关联性极差。为弥合这一评估差距,我们引入一个以LLM为裁判者的系统,通过DSPy中的GEPA进行程序化优化,以复制专家的临床评估。优化后的裁判者(Gemini-2.5-Pro)取得了人类可比的性能,准确率达90%,Cohen's kappa为0.816。本工作提供了一个经过验证的、自动化的框架,使ASR评估从简单的文本忠实度,发展为临床对话安全性的必要且可扩展的评估。

关键词

引用

@article{arxiv.2511.16544,
  title  = {WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue},
  author = {Zachary Ellis and Jared Joselowitz and Yash Deo and Yajie He and Anna Kalygina and Aisling Higham and Mana Rahimzadeh and Yan Jia and Ibrahim Habli and Ernest Lim},
  journal= {arXiv preprint arXiv:2511.16544},
  year   = {2026}
}

备注

Published as an Oral at IWSDS 2026