剖析语言模型中的临床推理:提示与模型适应策略的比较研究
计算与语言
2025-07-08 v1 人工智能
摘要
最近关于大型语言模型(LLMs)的研究已经证明了提示策略和微调技术对其推理能力的影响。然而,它们在临床自然语言推理(NLI)中的有效性仍未得到充分探索。本研究首次对提示结构和高效微调如何共同塑造临床NLI中的模型性能进行了受控评估。我们检查了四类提示策略,以在不同抽象层次上激发LLMs的推理,并评估了它们对一系列临床动机推理类型的影响。对于每种提示策略,我们使用前沿模型构建高质量示例,通过低秩适应(LoRA)将多步推理能力蒸馏到较小的模型(4B参数)中。在基于NLI4CT基准微调的不同语言模型上,我们发现仅提示类型就解释了macro-F1中高达44%的方差。此外,LoRA微调带来了+8到12个F1分的一致提升,将输出一致性提高到97%以上,并将与GPT-4o-mini的性能差距缩小到7.1%以内。关于推理泛化的额外实验表明,LoRA在MedNLI和TREC Clinical Trials Track上提高了75%模型的性能。总体而言,这些发现表明:(i)提示结构是临床推理性能的主要驱动因素;(ii)配备强大提示和LoRA的紧凑模型可以与前沿规模系统相媲美;(iii)基于推理类型的评估对于揭示提示引入的权衡至关重要。我们的结果突显了结合提示设计和轻量级适应以构建更高效、更可信的临床NLP系统的前景,并提供了关于广泛采用的提示和参数高效技术在高度专业化领域中的优势和局限性的见解。
引用
@article{arxiv.2507.04142,
title = {Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies},
author = {Mael Jullien and Marco Valentino and Leonardo Ranaldi and Andre Freitas},
journal= {arXiv preprint arXiv:2507.04142},
year = {2025}
}