中文

VIGOR+:基于 LLM-CEVAE反馈环的迭代混杂因子生成与验证

人工智能 2025-12-23 v1 机器学习

摘要

隐藏混杂因子是从观测数据进行因果推断的根本性挑战。最近的进展利用大语言模型 (LLM) 生成基于领域知识的可信隐藏混杂因子,但存在一个关键缺口:LLM 生成的混杂因子往往在语义上合理,却缺乏统计效用。我们提出 VIGOR+ (Variational Information Gain for iterative cOnfounder Refinement),一个新框架,通过 LLM-CEVAE 反馈环闭合 LLM 生成与统计验证之间的差距。不同于以往将生成和验证视为独立阶段的方法,VIGOR+ 建立了一个迭代反馈机制:来自 CEVAE 的验证信号(包括信息增益、潜在一致性指标和诊断消息)被转化为自然语言反馈,用于指导后续 LLM 生成轮次。该迭代细化持续进行,直到满足收敛准则。我们形式化了反馈机制,在温和假设下证明了收敛性质,并提供了完整的算法框架。

关键词

引用

@article{arxiv.2512.19349,
  title  = {VIGOR+: Iterative Confounder Generation and Validation via LLM-CEVAE Feedback Loop},
  author = {JiaWei Zhu and ZiHeng Liu},
  journal= {arXiv preprint arXiv:2512.19349},
  year   = {2025}
}

备注

7 pages,1 figure,4 tables