中文

大语言模型扰动影响的量化

机器学习 2024-12-03 v1 计算与语言 统计理论 机器学习 统计理论

摘要

我们考虑如何量化输入扰动对大语言模型(LLM)输出影响的问题,这是模型可靠性和事后可解释性的基本任务。在该领域的一个关键障碍是消除LLM输出内在随机性与模型响应中有意义变化。为克服这一困难,我们引入分布基扰动分析(DBPA),将LLM扰动分析重新表述为频率学假设检验问题。DBPA通过蒙特卡洛抽样在低维语义相似性空间中构造经验的零假设和备择输出分布。通过在降维空间中的蒙特卡洛估计比较,实现可行的频率学推断,而无需依赖限制性分布假设。该框架具有模型中性,支持对任意黑盒LLM评估任意输入扰动,产生可解释的p值,支持受控错误率下的多扰动测试,并为任意选定的相似性或距离度量标准提供标量效应大小。我们展示了DBPA在评估扰动影响方面的有效性,显示其在扰动分析中的多样性。

关键词

引用

@article{arxiv.2412.00868,
  title  = {Quantifying perturbation impacts for large language models},
  author = {Paulius Rauba and Qiyao Wei and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2412.00868},
  year   = {2024}
}

备注

Statistical Foundations of LLMs and Foundation Models Workshop at NeurIPS 2024