大型语言模型构建两级分数实验设计的系统评估
统计方法学
2026-03-13 v2 统计计算
摘要
两级分数实验设计允许使用有限的运行次数来研究多个因素。传统上,这些设计来自标准教科书或统计软件中的目录。然而,现代大型语言模型(LLM)现在可以生成两级分数实验设计,但这些设计的质量尚未进行之前的评估。本文对两种流行的LLM类,即GPT和Gemini模型,进行系统评估,以构建具有8、16和32次运行次数的两级分数实验设计,因子数量从4到26个。为此,我们使用提示技术开发了一套高质量的设计构建任务,以供LLM执行。我们将LLM获得的设计与以最佳已知设计为准的标准进行比较,准则包括分辨率和最小失真。我们表明,LLM能够有效构建具有最多8个因子的8、16和32运行次数的最优实验设计。
引用
@article{arxiv.2512.17113,
title = {A systematic assessment of Large Language Models for constructing two-level fractional factorial designs},
author = {Alan R. Vazquez and Kilian M. Rother and Marco V. Charles-Gonzalez},
journal= {arXiv preprint arXiv:2512.17113},
year = {2026}
}
备注
31 pages, 11 tables