谁在何处失败?大语言模型与人类在子宫内膜腺肿超声报告抽取中的错误模式
人机交互
2026-01-27 v2
摘要
本研究评估了本地部署的大语言模型(LLM),将非结构化的子宫内膜腺肿经阴道超声(eTVUS)扫描报告转换为结构化数据,以适用于影像信息学工作流程。在49份eTVUS报告中,我们将三个大语言模型(7B/8B及20B参数模型)与专家人类抽取进行比较。20B模型实现了86.02%的平均准确率,显著优于较小的模型,确认了规模在处理复杂临床文本中的重要性。关键的是,我们识别出高度互补的错误轮廓:LLM在语法一致性(例如日期/数字格式)方面表现突出,而人类在语义和上下文解释方面更优。我们还发现,LLM的语义错误是根本性的局限性,无法通过简单的提示工程来缓解。这些发现强有力地支持了人机协同(HITL)工作流程,其中本地部署的LLM作为协作工具,而非完全取代工具。它自动化了常规结构化处理,并标记潜在的人类错误,使影像专家能够专注于高层语义验证。我们讨论了结构化报告和临床实践中交互式AI系统的影响。
引用
@article{arxiv.2601.09053,
title = {Who Fails Where? LLM and Human Error Patterns in Endometriosis Ultrasound Report Extraction},
author = {Haiyi Li and Yutong Li and Yiheng Chi and Alison Deslandes and Mathew Leonardi and Shay Freger and Yuan Zhang and Jodie Avery and M. Louise Hull and Hsiang-Ting Chen},
journal= {arXiv preprint arXiv:2601.09053},
year = {2026}
}