利用图协方差和大语言模型解释分类特征的相互作用
机器学习
2025-01-28 v1 人工智能
机器学习
摘要
现代数据集通常包含大量样本、丰富特征及其关联时间戳。分析此类数据以揭示潜在事件通常需要复杂的统计方法和大量领域专业知识。本文的主要数据焦点是来自 Counter Trafficking Data Collaborative (CTDC) 的全球合成数据集——该数据集是人口贩运数据的全球中心,包含超过 20 万条匿名记录,覆盖 2002 年至 2022 年,每条记录包含众多分类特征。本文提出一种快速且可扩展的方法,用于分析和提取显著的分类特征相互作用,并查询大语言模型 (LLM) 以生成解释这些相互作用的数据驱动见解。我们的方法首先对分类特征进行二值化处理(使用 one-hot 编码),随后计算每个时间点的图协方差。该图协方差量化了分类数据中依赖结构随时间的变化,已在伯努利分布下证明为一致的依赖度量。我们使用该度量识别显著特征对,例如具有最频繁趋势的时间序列或在特定时刻显示依赖骤升的特征对。这些提取的特征对及其时间戳随后传递给 LLM,以生成解释这些依赖变化背后事件的可能解释。通过大量仿真实验,我们展示了该方法的有效性;将其应用于 CTDC 数据集后,发现了有意义的特征对以及观察到的特征相互作用所蕴含的潜在数据故事。
引用
@article{arxiv.2501.14932,
title = {Explaining Categorical Feature Interactions Using Graph Covariance and LLMs},
author = {Cencheng Shen and Darren Edge and Jonathan Larson and Carey E. Priebe},
journal= {arXiv preprint arXiv:2501.14932},
year = {2025}
}
备注
18 pages main + 6 pages appendix