中文

双词测试:面向大语言模型的语义基准

计算与语言 2023-06-08 v1 人工智能

摘要

大语言模型(LLMs)近期展现出非凡能力,包括通过高级专业考试与高要求基准测试。此表现令许多人认为其已接近实现类人或“真正”的语言理解,甚至通用人工智能(AGI)。在此,我们提供一种新的开源基准,可利用双词短语评估LLMs的语义能力,该任务未经高级训练的人类相对容易完成。将多个词组合为单一概念是人类语言与智能的基本方面。该测试要求对1768个名词-名词组合进行意义性判断,这些组合已由150名人类评分者评为有意义(如baby boy)或无意义(如goat sky)。我们提供该任务的两种版本,分别探查0-4量表的意意义性评分与二元判断。我们使用TWT对GPT-4、GPT-3.5与Bard进行了两版任务的系列实验。结果表明,相较于人类,所有模型在这些短语的意义性评分上表现糟糕。GPT-3.5与Bard亦无法像人类那样对合理与无意义短语做出二元区分。GPT-4在组合短语的二元区分上有实质提升,但仍显著劣于人类表现。TWT可用于理解当前LLMs的局限与弱点,并潜在改进之。该测试也提醒我们,将“真正理解”或AGI归于LLMs须谨慎。TWT获取地址:https://github.com/NickRiccardi/two-word-test

关键词

引用

@article{arxiv.2306.04610,
  title  = {The Two Word Test: A Semantic Benchmark for Large Language Models},
  author = {Nicholas Riccardi and Rutvik H. Desai},
  journal= {arXiv preprint arXiv:2306.04610},
  year   = {2023}
}

备注

12 pages, 5 figures, 3 tables, submitted to NeurIPS 2023 Datasets and Benchmarks Track