中文

大型语言模型是否独立?关于行为 entangled 和重加权验证器集体的统计审计框架

人工智能 2026-04-10 v1 计算与语言

摘要

大型语言模型(LLM)生态系统的快速发展引发了一个关键问题:看似多样化的模型是否真正独立?共享的预训练数据、蒸馏和对齐管道可能导致隐藏的行为依赖性,即所谓的行为 entangled,削弱了诸如 LLM 作为裁判管道和验证器集体等多模型系统,这些系统隐式假设独立信号。在实践中,这表现为相关的推理模式和同步的错误,使得表面的一致性反映的是共享的错误模式,而非独立的验证。为此,我们发展了一个用于审计黑盒 LLM 之间行为 entangled 的统计框架。我们的方法引入一个多分辨率层级,通过两种信息论指标来刻画联合失效流形:(i)难度加权行为 entangled 指数,通过放大易任务上的同步失效来放大这种现象;(ii)累积信息增益(CIG)指标,捕捉错误响应中的方向性对齐。通过对 18 个来自 6 个模型家族的 LLM 进行大量实验,我们识别出广泛的行为 entangled,分析其对 LLM 作为裁判评估的影响。我们发现,CIG 与裁判精度的下降呈统计显著相关性,GPT-4o-mini 的 Spearman 系数为 0.64(p < 0.001),Llama3 系列裁判的系数为 0.71(p < 0.01),表明更强的依赖性对应更高的过度认可偏差。最后,我们展示了通过 de-entangled 验证器集体重加权实现实际应用。通过根据推断的独立性调整模型贡献,所提出的方法可减轻相关偏差并提升验证性能,准确率相较于多数投票提升最高可达 4.5%。

引用

@article{arxiv.2604.07650,
  title  = {How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles},
  author = {Chenchen Kuai and Jiwan Jiang and Zihao Zhu and Hao Wang and Keshu Wu and Zihao Li and Yunlong Zhang and Chenxi Liu and Zhengzhong Tu and Zhiwen Fan and Yang Zhou},
  journal= {arXiv preprint arXiv:2604.07650},
  year   = {2026}
}

备注

9 pages, 4 figures