评估大语言模型生成的数据验证测试的恰当性与一致性
统计方法学
2024-04-02 v2
摘要
我们研究了大语言模型(LLMs)是否能够开发数据验证测试。我们针对 GPT-3.5 和 GPT-4 各考虑了 96 种条件,考察了不同的提示场景、学习模式、温度设置和角色。提示场景为:1)询问期望,2)在给定上下文的情况下询问期望,3)在请求数据模拟后询问期望,以及 4)在提供数据样本的情况下询问期望。学习模式为:1)零样本,2)单样本,以及 3)少样本学习。我们还测试了四种温度设置:0、0.4、0.6 和 1。两个不同角色为:1)有帮助的助手,2)专家数据科学家。为衡量一致性,每种设置均测试五次。LLM 生成的响应与一个由熟悉相关数据的经验丰富数据科学家创建的黄金标准数据验证套件进行基准比较。我们发现少样本学习具有可观的收益,且数据场景越明确越好,但存在限度。最佳的 LLM 配置是对黄金标准结果的补充而非替代。本研究强调了 LLM 能为数据科学工作流中的数据清洗与准备阶段带来的价值,但也指出其需要经验丰富分析人员的充分评估。
引用
@article{arxiv.2310.01402,
title = {Evaluating the Decency and Consistency of Data Validation Tests Generated by LLMs},
author = {Rohan Alexander and Lindsay Katz and Callandra Moore and Michael Wing-Cheung Wong and Zane Schwartz},
journal= {arXiv preprint arXiv:2310.01402},
year = {2024}
}
备注
36 pages, 18 figures