论证论文政治位置预测的有效性
计算与语言
2026-02-23 v1 人工智能
摘要
现实世界的知识表示往往需要捕捉主观的、连续的属性——例如政治立场——这些属性与两两验证(pairwise validation)相冲突,而后者是人类评估的广泛接受金标准。我们通过应用于论辩语境中的政治立场预测,结合点评估和两两人工标注的双尺度验证框架来解决这一挑战。使用22个语言模型,我们构建了来自30场英国政治电视节目《提问时刻》(Question Time)中23,228个论点的数据驱动知识库。点评估显示,人类-模型间的 moderate 一致性(Krippendorff's ),反映出内在的主观性;而两两验证则显示,人类-模型排名间的一致性显著更强(最佳模型的)。本工作贡献包括:(i)一种平衡可扩展性与可靠性的主观连续知识验证方法;(ii)一个为图基推理和检索增强生成在政治领域提供支持的已验证结构化论证知识库;(iii)证据表明,来自本质上主观的现实语境中,点评语言模型的预测可提取出序数结构,推动了知识表示在传统符号或分类方法不足之处的能力。
引用
@article{arxiv.2602.18351,
title = {Validating Political Position Predictions of Arguments},
author = {Jordan Robinson and Angus R. Williams and Katie Atkinson and Anthony G. Cohn},
journal= {arXiv preprint arXiv:2602.18351},
year = {2026}
}
备注
13 pages, 6 figures, 6 tables. Under review