中文

我们可以依赖LLM吗?GPT-4能力的固定效应谬误与论点

人工智能 2024-09-25 v2 计算与语言 机器学习

摘要

本文探讨了大语言模型 (LLM) 能力的评估问题。我们对GPT-4在几个确定性任务上的性能进行测量;每项任务都涉及基本计算,以来自大规模明确定义人群的某些元素作为输入参数(例如,计数列表中的元素、乘以两个k位数等)。我们 per-task 检查了多个条件,并进行足够的试验,以便能够检测到统计显著差异。这使我们能够 investigate 任务准确性对查询措辞和输入参数人群的灵敏度。我们发现,看似微小的任务提示或输入人群修改,都可能导致远超抽样效应所能解释的差异。例如,简单列表计数任务的性能会随查询措辞、列表长度、列表组成(即计数的对象)以及对象频率(例如,当某个元素占列表约50%时成功率与占约70%时成功率不同)而变化。我们得出结论,量化LLM能力的努力很容易陷入语言作为固定效应的谬误,即实验观察被错误地泛化到数据支持之外的范围。一个后果是,基于与人类交互所形成的直觉,对于哪些输入修改应“没有影响”于LLM性能几乎不可靠。

关键词

引用

@article{arxiv.2409.07638,
  title  = {Can We Count on LLMs? The Fixed-Effect Fallacy and Claims of GPT-4 Capabilities},
  author = {Thomas Ball and Shuo Chen and Cormac Herley},
  journal= {arXiv preprint arXiv:2409.07638},
  year   = {2024}
}