中文

谁获得肾脏?人机对齐、未决与道德价值观

计算机与社会 2026-04-21 v2 人工智能 机器学习

摘要

大型语言模型(LLMs)在高风险决策中的快速整合——例如分配供体器官等稀缺资源——引发了关于其与人类道德价值观对齐的关键问题。我们系统地评估了几种 prominent LLMs 在肾脏分配场景中相对于人类偏好的行为,并表明 LLMs:i) 在优先考虑各种属性时表现出与人类价值观的明显偏离;ii) 与人类相反,LLMs 极少表达未决,即使在提供了替代的未决机制(如抛硬币)时,它们也选择确定性决策。尽管如此,我们表明使用少量样本的低秩监督微调通常在改善决策一致性以及校准未决建模方面是有效的。这些发现说明了在道德/伦理领域对 LLMs 采用显式对齐策略的必要性。

关键词

引用

@article{arxiv.2506.00079,
  title  = {Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values},
  author = {John P. Dickerson and Hadi Hosseini and Samarth Khanna and Leona Pierce},
  journal= {arXiv preprint arXiv:2506.00079},
  year   = {2026}
}