评估大型语言模型在因果建模中的性能
计算与语言
2024-11-26 v1
摘要
本文考虑将因果领域知识转化为更贴近因果数据科学指南的表示方法。为此,我们引入两个与提炼因果领域知识至因果变量和检测相互作用实体相关的新任务。我们确定,当代大型语言模型是协助人类专家进行因果建模任务的有用工具,因为它们能提供更广泛的视角。具体而言,像 GPT-4-turbo 和 Llama3-70b 这样的大型语言模型,在将因果领域知识提炼为因果变量方面优于稀疏专家模型(如 Mixtral-8x22b),而稀疏专家模型如 Mixtral-8x22b 在识别相互作用实体方面表现最为出色。最后,我们强调,实体生成的领域与所选大型语言模型在因果建模中的性能之间存在依赖关系。
引用
@article{arxiv.2411.15888,
title = {Evaluating Large Language Models for Causal Modeling},
author = {Houssam Razouk and Leonie Benischke and Georg Niess and Roman Kern},
journal= {arXiv preprint arXiv:2411.15888},
year = {2024}
}
备注
13 pages, 6 figutrd, 4 tabels