中文

GRASP:基于交互图的确定性论证排序

机器学习 2026-05-20 v1 人工智能 计算与语言 计算机与社会 人机交互

摘要

大型语言模型越来越多地被部署为自动评判员,以评估论证强度。随着这一角色的扩展,其合法性取决于一致性、透明度以及能够将论证结构与修辞吸引力区分开来。然而,我们表明,整体评判——一种常见的 LLM 作为评判员实践——在模型之间存在显著的 inter-model 不一致。我们认为,这种不稳定性源于将论辩的复杂交互结构坍缩为单个不透明的评分。为此,我们提出 GRASP(Gradual Ranking with Attacks and Support Propagation,渐进式排序与攻击与支持传播),一个聚合稳定局部交互判断的确定性框架,通过收敛的攻击-防御传播算子生成全局排序。我们表明,局部交互判断在 LLM 作为评判员评估中比整体排序更可重复,从而使 GRASP 能够产生更一致的全局排序。我们进一步表明,GRASP 分数不与人类“说服力”标签相关,这突显了一种关键的社会技术区分:GRASP 不衡量说服力、事实性或修辞吸引力,而是衡量结构充分性——即一种以防御为导向的论证鲁棒性概念,基于显式的交互图。总体而言,GRASP 提供了整体 LLM 评判的透明且可审计的替代方案。

关键词

引用

@article{arxiv.2605.19141,
  title  = {GRASP: Deterministic argument ranking in interaction graphs},
  author = {Diganta Misra and Antonio Orvieto and Rediet Abebe and Volkan Cevher},
  journal= {arXiv preprint arXiv:2605.19141},
  year   = {2026}
}

备注

Preprint