面向不定数据中的因果关系:基线模型与新数据集
机器学习
2024-01-17 v1 人工智能
摘要
将深度学习与因果发现相结合,促使我们认识到在对话和视频中学习因果结构与表示充满挑战。我们将这些数据形式定义为“不定数据”,其特点是多结构数据与多值表示。与现有的可适应数据形式不同,不定数据在数据集和方法上仍存在空白。为填补数据集空白,我们发布了两个高质量数据集——Causalogue 和 Causaction,分别包含带有因果标注的文本对话样本和视频动作样本。此外,方法空白源于多结构数据与多值表示的共存,这打破了所有现有方法的假设,使其在不定数据上不可行。为此,我们提出一个概率框架作为基线,针对这一空白设计了三个亮点:1) 利用非固定因果结构下噪声项的独立性建立表示的因果条件;2) 将因果强度视为潜在变量,并在相关空间中测量重构损失;3) 估计潜在混杂因素的影响。这些亮点使概率模型能够克服多结构数据与多值表示共存带来的挑战,并为潜在混杂因素的扩展铺平道路。综合实验评估了因果结构、因果表示和混杂解缠的基线结果。
引用
@article{arxiv.2401.08221,
title = {Towards Causal Relationship in Indefinite Data: Baseline Model and New Datasets},
author = {Hang Chen and Xinyu Yang and Keqing Du},
journal= {arXiv preprint arXiv:2401.08221},
year = {2024}
}
备注
If you are interested in the two new datasets, pls contact us by email