StatLLM:用于评估大型语言模型在统计分析中的性能的数据集
光学
2025-02-26 v1 介观与纳米尺度物理
材料科学
摘要
大型语言模型(LLM)的代码能力为机器学习和数据科学中的自动统计分析开辟了新机会。然而,在广泛采用之前,关键是评估 LLM 生成代码的准确性。这种评估面临的主要挑战在于缺乏针对统计代码(如 SAS 和 R)的基准数据集。为填补这一空白,本文介绍了 StatLLM,一个用于评估 LLM 在统计分析中性能的开源数据集。StatLLM 数据集包含三个关键组件:统计分析任务、LLM 生成的 SAS 代码以及人类评估得分。第一个组件包括各种统计分析任务和数据集,提供问题描述、数据集细节以及经人工验证的 SAS 代码。第二个组件包含由 ChatGPT 3.5、ChatGPT 4.0 和 Llama 3.1 为这些任务生成的 SAS 代码。第三个组件包含来自统计学专家对 LLM 生成代码正确性、有效性、可读性、可执行性和输出准确性的人类评估得分。我们还阐述了该建立的基准数据集在(1)评估和提升自然语言处理指标、(2)评估和改进 LLM 在统计编码方面的性能、(3)开发和测试下一代统计软件方面的独特潜力,这些进展对于数据科学和机器学习研究至关重要。
引用
@article{arxiv.2502.17656,
title = {High-Q, size-independent, and reconfigurable optical antennas via zero-index material dispersion engineering},
author = {Prasad P. Iyer and Mihir Pendharkar and Anchal Agrawal and Humberto Foronda and Mike Iza and Umesh K. Mishra and Shuji Nakamura and Steven DenBaars and Stacia Keller and Chris Palmstrøm and Jon A. Schuller},
journal= {arXiv preprint arXiv:2502.17656},
year = {2025}
}
备注
27 pages, 4 figures, 2 Supplmentary information figures,