中文

用于审计语言模型鲁棒性的统计假设检验

计算与语言 2025-06-10 v1

摘要

考虑语言模型(LLM)系统在任意干预(如输入扰动或更改模型变体)下的输出是否发生变化的问题。我们不能简单地比较两个 LLM 输出,因为它们可能因系统的随机性而不同;也不能比较整个输出分布,因为计算上不可行。虽然已有方法可用于分析基于文本的输出,但它们关注的根本不同的问题,如衡量偏见或公平性。为此,我们引入了基于分布的扰动分析,这一框架将 LLM 扰动分析重新表述为频率假设检验问题。我们通过蒙特卡洛抽样在低维语义相似性空间中构建经验的零假设和备择假设输出分布,从而实现可计算的推断,而无需限制性的分布假设。该框架(i)模型无关,(ii)支持对任意黑箱 LLM 评估任意输入扰动,(iii)产生可解释的 p 值;(iv)支持通过受控错误率进行多个扰动;(v)提供标量效应大小。我们在多个案例研究中展示了该框架的实用性,展示了如何量化响应变化、测量真/假正率以及评估与参考模型的对齐程度。最重要的是,我们将其视为 LLM 审计的可靠频率假设检验框架。

关键词

引用

@article{arxiv.2506.07947,
  title  = {Statistical Hypothesis Testing for Auditing Robustness in Language Models},
  author = {Paulius Rauba and Qiyao Wei and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2506.07947},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2412.00868