基于证据引导的强化学习框架评估:轻参数 LLM 在精神医学临床推理中的决策认知对齐
计算与语言
2026-02-09 v1
摘要
大型语言模型(LLM)在医学决策支持中展现出变革性潜力,但在精神医学领域的应用受限于幻觉和浅层推理。这一限制在轻参数 LLM 中尤为突出,而后者对隐私保护和高效临床部署至关重要。现有训练范式优先保证语言流畅性,忽略结构化临床逻辑,导致与专业诊断认知根本性错位。为此,我们引入 ClinMPO,一种强化学习框架,旨在将 LLM 的内部推理与专业精神医学实践对齐。该框架采用专门的奖励模型,该模型独立训练于 4474 篇精神医学期刊文章构成的 数据集,并依据证据医学原则进行结构化。我们在一个未见的基准子集上评估了 ClinMPO,此子集专门设计以隔离推理能力,区别于机械记忆。在该测试集上,领先的大参数 LLM 一致性表现不佳。我们将 ClinMPO 对齐后的轻参数 LLM 性能与 300 名医学生进行比较。ClinMPO 微调的Qwen3-8B 模型在这些复杂案例中达到 31.4% 的诊断准确率,超过人类基准的 30.8%。这些结果表明,医学证据引导的优化使轻参数 LLM 能够掌握复杂推理任务。我们的发现表明,显式认知对齐为可靠且安全的精神医学决策支持提供了可扩展的路径。
引用
@article{arxiv.2602.06449,
title = {Evaluating an evidence-guided reinforcement learning framework in aligning light-parameter large language models with decision-making cognition in psychiatric clinical reasoning},
author = {Xinxin Lin and Guangxin Dai and Yi Zhong and Xiang Li and Xue Xiao and Yixin Zhang and Zhengdong Wu and Yongbo Zheng and Runchuan Zhu and Ming Zhao and Huizi Yu and Shuo Wu and Jun Zhao and Lingming Hu and Yumei Wang and Ping Yin and Joey W. Y. Chan and Ngan Yin Chan and Sijing Chen and Yun Kwok Wing and Lin Lu and Xin Ma and Lizhou Fan},
journal= {arXiv preprint arXiv:2602.06449},
year = {2026}
}
备注
21 pages, 8 figures