中文

LLMs 在测试生成中的捷径:基于 SAP HANA 和 LevelDB 的研究

软件工程 2026-04-17 v1 人工智能

摘要

大型语言模型(LLMs)在公开基准测试中取得了令人瞩目的成绩,常常引发对其先进推理与理解能力的声称。然而,近期的认知科学研究表明,这些模型有时依赖浅层启发式和记忆,采取捷径而非展现出真正的认知能力。本文调查了LLMs在软件自动化测试生成中的行为,将性能与开源系统(LevelDB)进行比较,同时针对全球最广泛部署的商业数据库系统之一 SAP HANA(其专有代码绝不会出现在训练数据中)进行测试。我们结合认知评估原则,取决于Mitchell的机制导向评估方法论,结合实证软件测试,采用突变得分和迭代编译-反馈修复循环来评估准确性与底层推理策略。结果表明,LLMs在熟悉的开源基准测试中表现出色,但在未见的、复杂的领域中挣扎不已,常常优先考虑可编译性而非语义有效性。这些发现为更广泛的论点提供了独立的软件工程证据,即当前的LLMs缺乏稳健的推理能力,并突显了评估框架的必要性,这些框架应惩罚平凡的捷径,奖励真正的泛化。

关键词

引用

@article{arxiv.2604.14437,
  title  = {LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB},
  author = {Vekil Bekmyradov and Noah C. Pütz and Thomas Bartz-Beielstein},
  journal= {arXiv preprint arXiv:2604.14437},
  year   = {2026}
}