中文

Dynaboard:一个用于整体下一代基准测试的服务化评估平台

计算与语言 2021-06-14 v1 人工智能

摘要

我们介绍 Dynaboard,一个与 Dynabench 平台集成的、用于托管基准测试和进行整体模型比较的服务化评估框架。我们的平台直接评估 NLP 模型,而非依赖自报告指标或单一数据集上的预测。在这一范式下,模型被提交至云端进行评估,规避了可复现性、可访问性和向后兼容性等常常阻碍 NLP 基准测试的问题。这允许用户实时与已上传模型交互以评估其质量,并允许收集额外指标,如内存使用、吞吐量和鲁棒性——尽管这些对从业者至关重要,却传统上缺席于排行榜。在每个任务上,模型根据 Dynascore 排名,这是一种对这些统计量的基于效用的新型聚合,用户可自定义以更好地反映其偏好,对特定评估维度或数据集赋予更多/更少权重。随着最先进的 NLP 模型推动传统基准测试的极限,Dynaboard 为更多样化和全面的模型质量评估提供了标准化解决方案。

关键词

引用

@article{arxiv.2106.06052,
  title  = {Dynaboard: An Evaluation-As-A-Service Platform for Holistic Next-Generation Benchmarking},
  author = {Zhiyi Ma and Kawin Ethayarajh and Tristan Thrush and Somya Jain and Ledell Wu and Robin Jia and Christopher Potts and Adina Williams and Douwe Kiela},
  journal= {arXiv preprint arXiv:2106.06052},
  year   = {2021}
}