中文

价值敏感性差距:临床大型语言模型如何回应共享决策中的患者偏好陈述

计算机与社会 2026-03-03 v1 人工智能 机器学习

摘要

大型语言模型 (LLM) 正在临床工作流程中作为决策支持工具进入,但它们如何回应患者偏好陈述——这正是共享决策的核心内容——尚未被测量。我们进行了一次因子实验,使用源自 98,759 条去标识化的 Medicaid 就诊记录的临床情景进行测试。我们测试了四类 LLM(GPT-5.2、Claude 4.5 Sonnet、Gemini 3 Pro 和 DeepSeek-R1),在两个临床领域中测试 13 种价值情境,共产生 104 项试验。不同模型家族的默认价值取向差异较大( aggressiveness 范围为 1.0~5.0 量表上的 2.0~3.5)。价值敏感性指数范围为 0.13~0.27,患者偏好陈述的方向一致性范围为 0.625~1.0。所有模型在非控制试验中均以 100% 的比例确认了患者的价值观,但实际的推荐转变仍相对有限。决策矩阵和 VIM 自报告缓解措施分别在 78 项二期评估中将方向一致性提升 0.125。这些发现为填充临床 AI 治理框架提议的价值披露标签提供了实证数据。

关键词

引用

@article{arxiv.2603.00076,
  title  = {The Value Sensitivity Gap: How Clinical Large Language Models Respond to Patient Preference Statements in Shared Decision-Making},
  author = {Sanjay Basu},
  journal= {arXiv preprint arXiv:2603.00076},
  year   = {2026}
}

备注

38 pages, 4 figures, supplementary appendix included