中文

LLM能排序吗?三元组与分诊的故事

计算机与社会 2026-06-29 v1 人工智能

摘要

从为无家可归家庭分配住房到急诊科分诊,LLM越来越多地被考虑作为需要为稀缺资源对人进行排序的关键决策的评判者。同时排序大型群体在认知上要求很高且容易出错。一个自然的解决方案,借鉴了数十年的社会选择理论,是引出成对比较并将它们聚合成一个总顺序。然而,当LLM作为成对评判者时,一个基本问题仍然存在:在承诺排序之前,从业者如何判断LLM的判断是否足够一致以信任结果?我们讨论了识别一致性的两种不同方式。一个经典的诊断方法,一致性系数 ζ\zeta,最初是为了通过计算锦标赛图中的循环三元组来衡量评判者可靠性而开发的,提供了一种廉价的、无模型的方法来衡量运行内一致性。各种标准的排序间距离度量,例如Kendall的 τ\tau,可以衡量运行间变异性。我们在理论和实践中都表明,这些度量是独立有价值的,并主张同时使用两者来评估排序的可靠性。我们在两个高风险的优先级排序任务中证明了我们结果的实际重要性:无家可归者服务分配和急诊科分诊。三个不同的领先LLM在这两个一致性轴上表现出相当不同的性能特征。我们为从业者提供了在承诺使用模型进行排序或优先级排序之前如何衡量和评估一致性的指导方针。

关键词

引用

@article{arxiv.2606.30412,
  title  = {Can LLMs Rank? A Tale of Triads and Triage},
  author = {Gaurab Pokharel and Shafkat Farabi and Patrick J. Fowler and Sanmay Das},
  journal= {arXiv preprint arXiv:2606.30412},
  year   = {2026}
}