中文

EvoGrad:结合人类对抗者的 Winograd 模式挑战动态方案

计算与语言 2024-02-23 v2

摘要

虽然大型语言模型(LLM)在 Winograd 模式挑战(WSC,一项通过代词消歧测试常识推理的共指消解任务)中表现出色,但它们在处理包含微小改动或重述的实例时却举步维艰。为解决这一问题,我们推出了 EvoGrad,这是一个开源平台,利用人机回环(human-in-the-loop)方法构建了一个针对此类改动后 WSC 实例的动态数据集。借助 ChatGPT 的能力,我们将任务实例从 182 个扩展至 3,691 个,为多样化的常识推理数据集设立了新的基准。此外,我们引入了“错误深度”(error depth)指标,以评估模型在动态任务中的稳定性。我们的结果强调了 EvoGrad 带来的挑战:即使是表现最佳的 LLM(GPT-3.5),其准确率也仅为 65.0%,平均错误深度为 7.2,这与人类在无扰动错误情况下 92.8% 的准确率形成鲜明对比。这突显了当前模型的局限性以及动态数据集在揭示这些局限性方面的价值。

关键词

引用

@article{arxiv.2402.13372,
  title  = {EvoGrad: A Dynamic Take on the Winograd Schema Challenge with Human Adversaries},
  author = {Jing Han Sun and Ali Emami},
  journal= {arXiv preprint arXiv:2402.13372},
  year   = {2024}
}

备注

Accepted for publication in main proceedings of LREC-COLING 2024, 16 pages, 3 figures