为何思维链在临床文本理解中失效
计算与语言
2025-12-09 v2 人工智能
摘要
大语言模型(LLM)正日益被应用于临床护理领域,在该领域中,准确性和透明推理对于安全且可信的部署至关重要。思维链提示通过引导逐步推理,已在广泛的任务中展现出性能和可解释性的提升。然而,其在临床环境中的有效性很大程度上仍未被探索,尤其是在电子健康记录(EHR)的背景下——作为临床文档的主要来源,EHR 通常冗长、碎片化且充满噪声。在本工作中,我们首次针对临床文本理解中的 CoT 进行了大规模系统性研究。我们在 87 个真实世界临床文本任务上评估了 95 个先进的 LLM,涵盖 9 种语言和 8 种任务类型。与先前在其他领域的发现相反,我们观察到 86.3% 的模型在 CoT 设置下出现一致的性能下降。更强的模型保持相对稳健,而较弱的模型则出现大幅下降。为了更好地刻画这些效应,我们利用 LLM 作为评判者和临床专家评估,对推理长度、医学概念对齐和错误特征进行了细粒度分析。我们的结果揭示了 CoT 在临床环境中何时以及为何失效的系统性规律,这凸显了一个关键悖论:CoT 增强了可解释性,但可能削弱临床文本任务中的可靠性。本工作为 LLM 的临床推理策略提供了实证基础,突出了对透明且可信方法的需求。
引用
@article{arxiv.2509.21933,
title = {Why Chain of Thought Fails in Clinical Text Understanding},
author = {Jiageng Wu and Kevin Xie and Bowen Gu and Nils Krüger and Kueiyu Joshua Lin and Jie Yang},
journal= {arXiv preprint arXiv:2509.21933},
year = {2025}
}