中文

为聪明的汉斯敞开大门:简单特征预测LLM基准答案

计算与语言 2024-10-16 v1 人工智能

摘要

AI基准测试的完整性对于准确评估AI系统的能力至关重要。这些基准测试的内部效度——即确保它们不受混杂因素的影响——对于确保它们测量的是它们旨在测量的内容至关重要。在本文中,我们探讨了一个与内部效度相关的关键问题:AI系统可能以非预期的方式解决基准测试,绕过被测试的能力。这种现象在人类和动物实验中广为人知,通常被称为“聪明的汉斯”效应,即任务利用虚假线索解决,通常涉及比假定评估的过程简单得多的过程。先前的研究表明,语言模型也可能表现出这种行为。在几个较旧的自然语言处理(NLP)基准测试中,像“not”这样的单个n-gram被发现与正确标签高度相关,并且有监督的NLP模型已被证明会利用这些模式。在这项工作中,我们调查了从基准测试实例中提取的简单n-gram在多大程度上可以组合起来预测为LLM设计的现代多项选择基准测试中的标签,以及LLM是否可能使用这种n-gram模式来解决这些基准测试。我们展示了在这些n-gram上训练的简单分类器如何在几个基准测试上取得高分,尽管缺乏被测试的能力。此外,我们提供了证据表明现代LLM可能正在使用这些表面模式来解决基准测试。这表明这些基准测试的内部效度可能受到损害,在解释LLM在这些基准测试上的性能结果时应谨慎行事。

关键词

引用

@article{arxiv.2410.11672,
  title  = {Leaving the barn door open for Clever Hans: Simple features predict LLM benchmark answers},
  author = {Lorenzo Pacchiardi and Marko Tesic and Lucy G. Cheke and José Hernández-Orallo},
  journal= {arXiv preprint arXiv:2410.11672},
  year   = {2024}
}