中文

面向基于模型的指标的忠实模型评估

计算与语言 2024-01-01 v1

摘要

统计显著性检验用于自然语言处理 (NLP) 中,以确定研究或实验的结果是可能由偶然因素引起,还是反映了真实的关系。显著性检验的一个关键步骤是置信区间的估计,这是样本方差的函数。当针对真实值 (ground truth) 进行评估时,样本方差的计算是直接明了的。然而,在许多情况下,通常使用指标模型进行评估。例如,为了比较两个大型语言模型的毒性,会使用毒性分类器进行评估。现有工作通常不考虑因指标模型误差而导致的方差变化,这可能导致错误的结论。在本工作中,我们建立了基于模型的指标进行显著性检验的数学基础。通过在公开基准数据集和生产系统上的实验,我们表明,在计算基于模型的指标的样本方差时考虑指标模型误差,会改变某些实验的结论。

关键词

引用

@article{arxiv.2312.17254,
  title  = {Faithful Model Evaluation for Model-Based Metrics},
  author = {Palash Goyal and Qian Hu and Rahul Gupta},
  journal= {arXiv preprint arXiv:2312.17254},
  year   = {2024}
}