中文

Robustness Gym:统一 NLP 评估图景

计算与语言 2021-01-14 v1 人工智能 机器学习

摘要

尽管在标准基准上表现优异,深度神经网络在部署于真实世界系统时往往脆弱。因此,近期研究聚焦于测试此类模型的鲁棒性,产生了从对抗攻击到基于规则的数据变换等多样的评估方法。在本工作中,我们识别了评估 NLP 系统的挑战,并提出了一种以 Robustness Gym(RG)为形式的解决方案,这是一个简单且可扩展的评估工具包,统一了 4 种标准评估范式:子群体、变换、评估集与对抗攻击。通过提供通用评估平台,Robustness Gym 使从业者仅需几次点击即可比较来自全部 4 种评估范式的结果,并使用内置的一组抽象轻松开发与共享新颖评估方法。为验证 Robustness Gym 对从业者的效用,我们与一支情感建模团队开展了真实世界案例研究,揭示了 18%+ 的性能退化。为核实 Robustness Gym 可辅助新颖研究分析,我们执行了首个对 SOTA 商业与学术命名实体链接(NEL)系统的研究,以及对 SOTA 摘要模型的细粒度分析。对于 NEL,商业系统难以链接稀有实体,并落后其学术对应系统 10%+,而 SOTA 摘要模型在需要抽象与提炼的样例上表现困难,退化 9%+。Robustness Gym 可在 https://robustnessgym.com/ 获取。

关键词

引用

@article{arxiv.2101.04840,
  title  = {Robustness Gym: Unifying the NLP Evaluation Landscape},
  author = {Karan Goel and Nazneen Rajani and Jesse Vig and Samson Tan and Jason Wu and Stephan Zheng and Caiming Xiong and Mohit Bansal and Christopher Ré},
  journal= {arXiv preprint arXiv:2101.04840},
  year   = {2021}
}

备注

34 pages, 8 figures, 6 tables