面向 LLM 评判偏好分析的自动化概念发现
计算与语言
2026-03-05 v1 人工智能
摘要
大型语言模型 (LLM) 正在日益被用作模型输出的可扩展评估器,但其偏好判断呈现系统性偏差,且可能与人类评估存在偏离。先前的 LLM 评判工作主要聚焦于小规模、预先设定的偏差集合,留下了自动发现 LLM 偏好驱动因子的未决问题。我们通过研究多种嵌入级别概念提取方法来分析 LLM 评判行为,以解决这一差距。我们比较了这些方法在可解释性和可预测性方面的表现,发现稀疏自编码器方法在恢复可解释的偏好特征方面显著优于其他方法,同时在预测 LLM 决策方面保持竞争力。我们使用超过 27,000 条来自多个人类偏好数据集的配对响应以及来自三个 LLM 的判断,分析 LLM 的判断并将其与人类标注员的判断进行比较。我们的方法既验证了已有结果,例如 LLM 倾向于在更高率下拒绝敏感请求,超出人类水平,也发现了在通用和领域特定数据集上的新趋势,包括对强调具体性和同情心来应对新情况的响应的偏好、对学术建议中细节和正式程度的偏好,以及对鼓励主动行动(如报警或提起诉讼)的法律建议的偏差。我们的结果表明,自动化概念发现使无需预定义偏差分类法即可系统地分析 LLM 评判偏好。
引用
@article{arxiv.2603.03319,
title = {Automated Concept Discovery for LLM-as-a-Judge Preference Analysis},
author = {James Wedgwood and Chhavi Yadav and Virginia Smith},
journal= {arXiv preprint arXiv:2603.03319},
year = {2026}
}