中文

WSC+: 使用Tree-of-Experts增强Winograd Schema Challenge

计算与语言 2024-02-01 v1 计算机与社会

摘要

Winograd Schema Challenge (WSC) 是评估机器理解力的重要基准。虽然大型语言模型 (LLM) 在回答WSC问题上表现出色,但它们生成此类问题的能力仍较少被探索。在本工作中,我们提出了Tree-of-Experts (ToE),一种新颖的提示方法,增强了WSC实例的生成(50%的有效案例,而近期方法仅为10%)。利用该方法,我们引入了WSC+,一个包含3,026个LLM生成句子的新数据集。值得注意的是,我们通过引入新的“歧义”和“冒犯性”类别扩展了WSC框架,为模型过度自信和偏见提供了更深入的洞察。我们的分析揭示了生成-评估一致性的细微差别,表明与其他模型生成的问题相比,LLM在评估自己生成的问题上并不总是表现更好。在WSC+上,表现最优的LLM GPT-4达到了68.7%的准确率,显著低于95.1%的人类基准。

关键词

引用

@article{arxiv.2401.17703,
  title  = {WSC+: Enhancing The Winograd Schema Challenge Using Tree-of-Experts},
  author = {Pardis Sadat Zahraei and Ali Emami},
  journal= {arXiv preprint arXiv:2401.17703},
  year   = {2024}
}

备注

Accepted for publication in main proceedings of EACL 2024 conference, 22 pages, 16 figures