中文

基于混合 LLM 合成数据的因果推断技术探索

机器学习 2025-11-04 v1 人工智能 机器学习

摘要

大型语言模型 (LLM) 提供了生成合成表格数据的灵活方式,但现有方法往往未能保留诸如平均处理效应 (ATE) 等关键因果参数。本技术探索首先演示了最新的合成数据生成器(包括 GAN 和 LLM 基于方法)在保持高预测保真度的同时,对因果效应的估计严重偏差。为解决这一问题,我们提出了一种混合生成框架,结合基于模型的协变项合成(通过最近记录距离过滤器进行监控)与单独学习的倾向得分和结果模型,从而确保 (W, A, Y) 三元组保留其底层因果结构。我们进一步引入了合成配对策略以缓解正性违规问题,并提出了一种真实评估协议,利用无限合成样本对传统估计器(IPTW、AIPW、替换型)进行基准测试,适用于复杂协变分布。本工作为支持稳健因果分析的 LLM 驱动数据管道奠定了基础。我们的代码已公开于 https://github.com/Xyc-arch/llm-synthetic-for-causal-inference.git。

关键词

引用

@article{arxiv.2511.00318,
  title  = {A Technical Exploration of Causal Inference with Hybrid LLM Synthetic Data},
  author = {Dana Kim and Yichen Xu and Tiffany Lin},
  journal= {arXiv preprint arXiv:2511.00318},
  year   = {2025}
}

备注

9 pages, 4 figures