推理会伤害吗:面向临床 SOAP 笔记的源感知评估
计算与语言
2026-05-26 v1 人工智能
机器学习
摘要
启用推理的大语言模型在医学推理基准测试中表现优异,但这些收益是否传递至结构化临床文档尚不明了。我们采用 OMI Health、ACI-Bench 和 PriMock57 跨源的源感知基准,针对临床对话生成 SOAP 笔记来检验这一问题。我们评估了 GPT-5.4、DeepSeek-V4-Flash 和 Gemma-4-E4B,在受控 2x2 设计中独立切换提供商原生推理与同源检索增强生成(RAG)。输出采用七项自动指标以及两项参考感知 LLM 判官进行评估。两种评估方法一致表明,非推理配置的 GPT-5.4 在综合质量上取得最高分,而 DeepSeek-V4-Flash 在启用推理的配置中表现最佳。启用推理显著降低 GPT-5.4 在所有三个数据集上的表现,而同源 RAG 仅产生较小且模型依赖性的提升。总体而言,发现力量更大的推理能力并不一定提升面向忠实性敏感的 SOAP 笔记生成,除非采用专门的、任务特定的评估。
引用
@article{arxiv.2605.24902,
title = {When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation},
author = {Faizan Faisal},
journal= {arXiv preprint arXiv:2605.24902},
year = {2026}
}