中文

归属感是谁的?衡量 LLM 在多样化组织决策情境中的过程对齐

人工智能 2026-05-26 v1

摘要

将 AI 系统与组织决策对齐通常被表述为单一目标问题:使模型 behave like 组织。我们认为,这种表述掩盖了更深层的复数主义挑战。我们采用一种捕捉 decision-policy 的方法来衡量 process alignment:LLM 是否按组织方式加权信息,而不仅仅是是否得出相同结论。将其应用于 ECHR Article 6 决策,发现 process alignment 强烈预测 output accuracy (r = 0.85, p < .001),且 externalization 能显著提升对 poorly-aligned models 的对齐。将其应用于德国消费者信贷决策,这一关系则瓦解 (r = 0.15, p = .60):干预产生不一致的效果,而基准编码了潜在的歧视性历史模式。这一对比本身即为一种复数主义对齐发现:在有争议的领域中,高 process alignment 既不可通过 externalization 实现,也不可无条件取向。仅凭 output agreement 无法区分模型是 internalized 组织政策还是仅仅近似其 outcomes;process-level 测量是任何复数主义对齐评估的必要组成部分。

关键词

引用

@article{arxiv.2605.25256,
  title  = {Whose Alignment? Comparing LLM Process Alignment Across Diverse Organizational Decision Contexts},
  author = {Niklas Weller and Emilio Barkett},
  journal= {arXiv preprint arXiv:2605.25256},
  year   = {2026}
}

备注

Accepted to ICML 2026 Pluralistic Alignment Workshop