中文

互联网规模数据下的人机预测差异评估

机器学习 2024-11-12 v2 人工智能

摘要

在数据集上评估模型往往无法捕捉其在面对意外和多样化输入类型时的行为。若能针对互联网规模的输入量,或更一般地,针对枚举在计算上不可行的输入空间,评估人类标注与模型预测之间的差异,将大有裨益。传统的模型评估方法依赖精确率和召回率(PR)作为指标,通常通过在特定数据集上比较人类标注与模型预测来估算。这在枚举数千个测试输入是可行的情况下是合理的。然而,在巨大的输入空间中估算 PR 极具挑战性,因为枚举在计算上变得不可行。我们提出 OmniInput,这是一种通过输入空间的 PR 来评估和比较神经网络的新方法。OmniInput 与以往工作的不同之处在于,其估算的 PR 反映了对通常因过于庞大而无法枚举的输入空间中人类标注与模型预测差异的估计。我们在一个可枚举的输入空间内对我们的方法进行了实证验证,实验结果表明,OmniInput 能够有效地在不可枚举的广阔输入空间中估算和比较(大)语言模型的精确率与召回率。

关键词

引用

@article{arxiv.2312.03291,
  title  = {Evaluation of human-model prediction difference on the Internet Scale of Data},
  author = {Weitang Liu and Ying Wai Li and Yuelei Li and Zihan Wang and Yi-Zhuang You and Jingbo Shang},
  journal= {arXiv preprint arXiv:2312.03291},
  year   = {2024}
}