谁是你的裁判?论 LLM 生成评判的可检测性
人工智能
2025-09-30 v1
摘要
基于大语言模型(LLM)的评判利用强大的 LLM 高效评估候选内容并提供评判分数。然而,LLM 生成评判固有的偏见与脆弱性引发了担忧,凸显了在学术同行评审等敏感场景中对其进行区分的迫切需求。在本工作中,我们提出并形式化了评判检测任务,系统性地研究了 LLM 生成评判的可检测性。与 LLM 生成文本检测不同,评判检测仅依赖评判分数与候选内容,反映了检测过程中往往无法获取文本反馈的真实场景。我们的初步分析表明,现有的 LLM 生成文本检测方法表现不佳,因为它们无法捕捉评判分数与候选内容之间的交互——而这正是有效评判检测的关键方面。受此启发,我们引入了 \textit{J-Detector},一个轻量且透明的神经检测器,通过显式提取的语言特征与 LLM 增强特征,将 LLM 裁判的偏见与候选内容的属性相关联,以实现准确检测。跨多样数据集的实验证明了 \textit{J-Detector} 的有效性,并展示了其可解释性如何能够量化 LLM 裁判中的偏见。最后,我们分析了影响 LLM 生成评判可检测性的关键因素,并验证了评判检测在真实场景中的实用价值。
引用
@article{arxiv.2509.25154,
title = {Who's Your Judge? On the Detectability of LLM-Generated Judgments},
author = {Dawei Li and Zhen Tan and Chengshuai Zhao and Bohan Jiang and Baixiang Huang and Pingchuan Ma and Abdullah Alnaibari and Kai Shu and Huan Liu},
journal= {arXiv preprint arXiv:2509.25154},
year = {2025}
}
备注
Under review