中文

你的基准测试是否真的具有对抗性?AdvScore:基于人类 grounding 的对抗性评估

计算与语言 2025-02-20 v3

摘要

对抗性数据集应通过提供人类表现良好但模型表现不佳的样本来验证 AI 的鲁棒性。然而,随着模型的演进,数据集可能变得过时。衡量数据集是否仍具对抗性受制于缺乏标准化指标来衡量对抗性。我们提出 AdvScore,一种以人类为 grounding 的评估指标,通过捕捉模型与人类在不同能力上的差异,同时识别差劲样本。我们使用 AdvScore 动机驱动新的数据集创建流程,以实现真实且高质量的对抗性样本,进而收集了一个对抗性问答(QA)数据集 AdvQA。我们使用 9,347 个人类响应和十个语言模型的预测应用 AdvScore,追踪自 2020 年以来模型在五年间的改进。AdvScore 为实现与人类相当的鲁棒性提供指导。此外,它有助于确定对抗性数据集在多大程度上仍具挑战性,确保它们有效测试模型能力,而非反映过时或过于人工的困难。

关键词

引用

@article{arxiv.2406.16342,
  title  = {Is your benchmark truly adversarial? AdvScore: Evaluating Human-Grounded Adversarialness},
  author = {Yoo Yeon Sung and Maharshi Gor and Eve Fleisig and Ishani Mondal and Jordan Lee Boyd-Graber},
  journal= {arXiv preprint arXiv:2406.16342},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2401.11185