中文

大型语言模型构建两级分数实验设计的系统评估

统计方法学 2026-03-13 v2 统计计算

摘要

两级分数实验设计允许使用有限的运行次数来研究多个因素。传统上,这些设计来自标准教科书或统计软件中的目录。然而,现代大型语言模型(LLM)现在可以生成两级分数实验设计,但这些设计的质量尚未进行之前的评估。本文对两种流行的LLM类,即GPT和Gemini模型,进行系统评估,以构建具有8、16和32次运行次数的两级分数实验设计,因子数量从4到26个。为此,我们使用提示技术开发了一套高质量的设计构建任务,以供LLM执行。我们将LLM获得的设计与以最佳已知设计为准的标准进行比较,准则包括分辨率和最小失真。我们表明,LLM能够有效构建具有最多8个因子的8、16和32运行次数的最优实验设计。

关键词

引用

@article{arxiv.2512.17113,
  title  = {A systematic assessment of Large Language Models for constructing two-level fractional factorial designs},
  author = {Alan R. Vazquez and Kilian M. Rother and Marco V. Charles-Gonzalez},
  journal= {arXiv preprint arXiv:2512.17113},
  year   = {2026}
}

备注

31 pages, 11 tables