中文

面向临床场景的 NurValues:护理价值评估基准

计算与语言 2026-01-29 v2

摘要

尽管大型语言模型 (LLM) 已在医学知识和对话能力方面取得显著进展,但其在临床实践中的部署带来了新的风险:患者可能更愿意信任 LLM 生成的回答,而非护士的专业判断,从而加剧护士-患者冲突。这种风险凸显了迫切需要评估 LLM 是否与人类护士所遵循的核心护理价值相吻合的紧迫性。本工作引入首个护理价值对齐基准,包含从国际护理准则中提炼的五个核心价值维度:Altruism(无私)、Human Dignity(人类尊严)、Integrity(诚信)、Justice(正义)和 Professionalism(职业精神)。我们定义了两个层次的任务,考虑到新兴护士-患者冲突的两个特征。Easy-Level 数据集包含 2,200 组与护理价值一致或违反价值的实例,这些实例通过在三个不同层次医院的五个月纵向研究收集;Hard-Level 数据集包含 2,200 组嵌入情境线索和微妙误导信号的对话式实例,这些实例增加了对抗性复杂性,更好地反映了在护士-患者冲突情境中叙述者主观性和偏见。我们对 23 项最新 LLM 进行了护理价值对齐能力的评估,发现通用 LLM 在医学 LLM 中性能更好,Justice(正义)是最具挑战性的价值维度。作为首个面向医疗健康价值对齐的真实世界基准,NurValues 为 LLM 在临床医生-患者互动中应对伦理挑战提供了新视角。

关键词

引用

@article{arxiv.2505.08734,
  title  = {NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context},
  author = {Ben Yao and Qiuchi Li and Yazhou Zhang and Siyu Yang and Bohan Zhang and Prayag Tiwari and Jing Qin},
  journal= {arXiv preprint arXiv:2505.08734},
  year   = {2026}
}

备注

39 pages, 9 figures, 24 tables