中文

语言模型为何对谁对齐?关于高风险竞争需求下的主导层级测量

人工智能 2026-05-13 v1

摘要

在高风险专业场景中部署的语言模型面临来自用户、制度权威和专业规范之间的相互冲突的诉求。模型在这些诉求冲突时如何行动揭示了主导层级——一种关于竞争利益相关方的隐式排序,该排序决定例如医疗 AI 在收到医院管理员的成本削减指令时是遵从而损害基于证据的护理,还是因专业标准要求而拒绝。在 7136 个法律和医疗情境中,我们测试了十个前沿模型,发现这些模型在任务执行时经常未能遵守专业标准,例如起草文件时,当用户指令与之冲突——尽管在用户寻求咨询性指导时能充分维护这些标准。我们进一步发现,这些模型在用户、权威与专业标准之间所表现的层级在医疗和法律语境中不稳定,且在不同模型家族之间不一致。当未能遵守专业标准时,主要的失效机制是知识缺失:具备相关知识的模型会在不呈现冲突知识的情况下产生有害输出。在一个尤为令人担忧的案例中,我们发现一个推理模型在其推理痕迹中识别出相关知识——例如某药物已被撤回——却在面向用户的答案中压制此信息,并在权威压力下继续推荐该药物。任务表述、领域以及模型家族之间的对齐不一致性表明,当前的对齐方法,包括已发表的对齐层级,不太可能在模型部署于高风险专业场景时保持稳健性。

关键词

引用

@article{arxiv.2605.12120,
  title  = {To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands},
  author = {Fangyi Yu and Nabeel Seedat and Jonathan Richard Schwarz and Andrew M. Bean},
  journal= {arXiv preprint arXiv:2605.12120},
  year   = {2026}
}