WSC+: 使用Tree-of-Experts增强Winograd Schema Challenge
计算与语言
2024-02-01 v1 计算机与社会
摘要
Winograd Schema Challenge (WSC) 是评估机器理解力的重要基准。虽然大型语言模型 (LLM) 在回答WSC问题上表现出色,但它们生成此类问题的能力仍较少被探索。在本工作中,我们提出了Tree-of-Experts (ToE),一种新颖的提示方法,增强了WSC实例的生成(50%的有效案例,而近期方法仅为10%)。利用该方法,我们引入了WSC+,一个包含3,026个LLM生成句子的新数据集。值得注意的是,我们通过引入新的“歧义”和“冒犯性”类别扩展了WSC框架,为模型过度自信和偏见提供了更深入的洞察。我们的分析揭示了生成-评估一致性的细微差别,表明与其他模型生成的问题相比,LLM在评估自己生成的问题上并不总是表现更好。在WSC+上,表现最优的LLM GPT-4达到了68.7%的准确率,显著低于95.1%的人类基准。
引用
@article{arxiv.2401.17703,
title = {WSC+: Enhancing The Winograd Schema Challenge Using Tree-of-Experts},
author = {Pardis Sadat Zahraei and Ali Emami},
journal= {arXiv preprint arXiv:2401.17703},
year = {2024}
}
备注
Accepted for publication in main proceedings of EACL 2024 conference, 22 pages, 16 figures