通过大语言模型模拟表格数据集以快速探索关于真实实体的假设
人工智能
2024-11-28 v1
摘要
恐怖作家的童年会不会不如其他作家?尽管许多作家的生平细节已为人所知,但要定量地探索这种定性假设需要大量的人力,例如梳理大量作家的传记和访谈,并不断迭代寻找能反映定性兴趣的量化特征。本文探讨了通过 (1) 应用于估计具体实体(如特定人物、公司、书籍、动物种类和国家)的属性;(2) 执行现有的分析方法以揭示此类属性之间的可能关系(例如线性回归);以及在进一步自动化方面,(3) 应用于建议能帮助支撑特定定性假设的量化属性(例如在运行示例中,指与不良童年事件相关的数量)。希望能够通过人机协作的方式更快地筛选这些假设。我们的实验表明,大语言模型确实可以作为估计特定实体跨多个领域表格数据有用的估计器,并且这种估计随模型规模而改善。进一步的实验表明,大语言模型将感兴趣的定性假设映射到相关具体变量的潜力是巨大的。结论是,大语言模型为帮助阐明其训练数据中潜在的科学有趣模式提供了引人入胜的潜力。
引用
@article{arxiv.2411.18071,
title = {Simulating Tabular Datasets through LLMs to Rapidly Explore Hypotheses about Real-World Entities},
author = {Miguel Zabaleta and Joel Lehman},
journal= {arXiv preprint arXiv:2411.18071},
year = {2024}
}