大语言模型能否可靠地从冠状动脉造影报告中提取生理指标值?
计算与语言
2026-04-16 v1
摘要
冠状动脉造影报告包含临床相关的生理测量值,然而这些信息通常以非结构化的自然语言形式存在,限制了其在研究中的应用。我们研究使用大语言模型从葡萄牙语冠状动脉造影报告中自动提取这些值及其解剖位置。据我们所知,本研究是首次从大型(1342份报告)冠状动脉造影报告语料库中提取生理指标,也是少数关注冠状动脉造影或葡萄牙语临床文本的研究之一。我们在不同设置下探索了本地隐私保护的通用和医学大语言模型。提示策略包括零样本、少样本以及带有不合理示例的少样本提示。此外,我们应用了约束生成,并引入了一个基于正则表达式的后处理步骤。鉴于测量值的稀疏性,我们提出了一个多阶段评估框架,将格式有效性、值检测和值正确性分开,同时考虑了不对称的临床错误成本。本研究展示了LLM从葡萄牙语冠状动脉造影报告中提取生理指标的潜力。非医学模型表现相似,最佳结果是通过Llama配合零样本提示获得的,而GPT-OSS则表现出对提示变化最高的鲁棒性。虽然MedGemma展示了与非医学模型相似的结果,但MedLlama的结果在无约束设置下格式不符,并且在约束设置下性能显著较低。改变提示技术并添加正则表达式层在各模型上均未显示出显著改进,而使用约束生成则降低了性能,尽管其好处是允许使用那些无法遵循模板的特定模型。
引用
@article{arxiv.2604.13077,
title = {Can Large Language Models Reliably Extract Physiology Index Values from Coronary Angiography Reports?},
author = {Sofia Morgado and Filipa Valdeira and Niklas Sander and Diogo Ferreira and Marta Vilela and Miguel Menezes and Cláudia Soares},
journal= {arXiv preprint arXiv:2604.13077},
year = {2026}
}