中文

RealTCD:基于大语言模型从干预数据中发现时序因果

人工智能 2024-05-28 v2 机器学习 统计方法学

摘要

在智能运维领域,因果发现对于图谱构建的运维至关重要,可促进根因分析等下游工业任务。时序因果发现作为一种新兴方法,旨在利用干预数据直接从观测中识别变量间的时序因果关系。然而,现有方法主要聚焦于严重依赖干预目标的合成数据集,忽略了现实系统中隐藏的文本信息,无法针对真实工业场景进行因果发现。为解决这一问题,本文提出研究工业场景中的时序因果发现,其面临两个关键挑战:1)如何在实践中难以获取干预目标的情况下发现因果关系,以及 2)如何利用工业环境中可能复杂但丰富的系统文本信息来发现因果关系。为应对这些挑战,我们提出了 RealTCD 框架,该框架能够利用领域知识在无干预目标的情况下发现时序因果关系。具体而言,我们首先开发了一种基于分数的时序因果发现方法,该方法通过策略性掩码和正则化,能够在不依赖干预目标的情况下发现用于根因分析的因果关系。此外,通过采用大语言模型(LLM)处理文本并整合领域知识,我们引入了 LLM 引导的元初始化,从系统隐藏的文本信息中提取元知识以提升发现质量。我们在模拟和真实数据集上进行了大量实验,表明所提出的 RealTCD 框架在发现时序因果结构方面优于现有基线。

关键词

引用

@article{arxiv.2404.14786,
  title  = {RealTCD: Temporal Causal Discovery from Interventional Data with Large Language Model},
  author = {Peiwen Li and Xin Wang and Zeyang Zhang and Yuan Meng and Fang Shen and Yue Li and Jialong Wang and Yang Li and Wenweu Zhu},
  journal= {arXiv preprint arXiv:2404.14786},
  year   = {2024}
}