中文

大语言模型在选项长度、问题类型和无关名词替换上的泛化能力差

计算与语言 2025-09-23 v3 人工智能 机器学习

摘要

本文提出了一个“泛化压力测试”,以评估大语言模型(LLM)在轻微且受控的扰动下的泛化能力,包括选项长度、问题类型以及无关名词替换。我们发现,尽管 LLM 在基准测试中得分很高,但在面对这些微小且内容不变的修改时,仍会出现严重的准确率下降和意外偏差(例如倾向于选择较长的干扰项)。例如,Qwen 2.5 1.5B 的 MMLU 分数从 60 分上升到 89 分,却在更改选项长度后从 89 分下降到 36 分。即便是 GPT-4o 在更改问题类型后也经历了 25 分的准确率损失,在所有三种修改类别中平均下降 6 分。这些分析表明,LLM 依赖的并非是稳健的抽象表征,而是对格式、词汇变化以及无关内容变更的浅层线索。

关键词

引用

@article{arxiv.2502.12459,
  title  = {Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements},
  author = {Guangxiang Zhao and Saier Hu and Xiaoqi Jian and Jinzhu Wu and Yuhan Wu and Change Jia and Lin Sun and Xiangzheng Zhang},
  journal= {arXiv preprint arXiv:2502.12459},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference