中文

利用大语言模型揭示多模态因果关系

机器学习 2025-10-31 v2 人工智能

摘要

从数据中发现因果关系的机制是科学进步的根本。虽然大语言模型(LLM)在从非结构化数据中增强因果发现(CD)方面显示出前景,但其应用于日益普及的多模态环境仍面临关键挑战。即便是最近出现的多模态大语言模型(MLLM),其在多模态 CD 中的效能也受到两个主要限制:(1)在全面识别因果变量方面,难以探索模内和模间相互作用;(2)仅凭观察数据不足以处理结构性歧义。为此,我们提出了 MLLM-CD,一个用于从非结构化数据中进行多模态因果发现的新框架。它包含三个关键组件:(1)一个新的对比因子发现模块,用于基于对比样本对中探索的相互作用来识别真实的多模态因子;(2)一个统计因果结构发现模块,用于推断已发现因子之间的因果关系;(3)一个迭代的多模态反事实推理模块,通过纳入 MLLM 的世界知识和推理能力,不断细化发现结果。在合成数据和真实数据上的大量实验表明,所提出的 MLLM-CD 在从多模态非结构化数据中揭示真实因子及其之间的因果关系方面有效。

关键词

引用

@article{arxiv.2509.17784,
  title  = {Revealing Multimodal Causality with Large Language Models},
  author = {Jin Li and Shoujin Wang and Qi Zhang and Feng Liu and Tongliang Liu and Longbing Cao and Shui Yu and Fang Chen},
  journal= {arXiv preprint arXiv:2509.17784},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025