中文

基准透明度:度量数据对评估的影响

计算与语言 2024-04-02 v1 人工智能

摘要

本文对量化数据分布对 NLP 模型性能和评估的影响进行了探索性研究。我们提出了一个自动化框架,从 6 个不同维度度量数据点分布:歧义性、难度、可区分性、长度、噪声和困惑度。我们使用不成比例分层抽样来度量数据分布对绝对性能(Acc/F1)和相对性能(Rank)的影响程度。我们在 2 个不同的数据集(SQUAD 和 MNLI)上进行实验,共测试了 135 个不同的模型(SQUAD 上 125 个,MNLI 上 10 个)。我们证明,若不显式控制数据分布,标准评估框架是不一致且不可靠的。我们发现数据的影响在统计上是显著的,且通常大于改变度量指标带来的影响。在第二组实验中,我们证明数据对评估的影响不仅是可观察的,而且是可预测的。我们提出将基准透明度作为一种比较数据集并量化它们之间相似度的方法。我们发现“数据集相似度向量”可用于预测模型在分布外泛化的表现。

关键词

引用

@article{arxiv.2404.00748,
  title  = {Benchmark Transparency: Measuring the Impact of Data on Evaluation},
  author = {Venelin Kovatchev and Matthew Lease},
  journal= {arXiv preprint arXiv:2404.00748},
  year   = {2024}
}

备注

Accepted at NAACL 2024