基于 VINE copulas 的电子健康记录数据中多变量条件依赖分析
机器人学
2026-04-10 v1
摘要
电子健康记录 (EHR) 存储了来自大型患者群体的大量人口学和实验室变量。传统统计方法在处理混合类型数据 (连续型、序数型) 和捕捉大规模多变量数据中的非线性关系时受限,这些方法对 EHR 数据中异质变量的分布 (如高斯分布) 作出过于简化的假设。本文通过重新利用主要用于合成来自众多二元累积分布函数 (copulas) 的多变量分布的 VINE copulas 方法,来解决上述局限性。VINE copulas 产生表示在不同层次结构下的二元条件依赖关系的树结构,从而分解多变量分布。该树结构用于对变量进行条件依赖排序,并识别具有局部依赖的核心变量子集,从而简化高维 EHR 数据的概率挖掘。本文提出的 VINE copulas 方法用于识别共病条件之间的条件依赖,并用于验证不同 EHR 患者队列的特征。本文的贡献在于提供一种新方法,用于探索医疗数据的概率性挖掘,该方法提供数据驱动的解释、可视化和变量选择,以预测医疗结果。源代码已公开分享。
关键词
引用
@article{arxiv.2604.07705,
title = {Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models},
author = {Xingyu Xia and Lekai Zhou and Yujie Tang and Xiaozhou Zhu and Hai Zhu and Wen Yao},
journal= {arXiv preprint arXiv:2604.07705},
year = {2026}
}
备注
28 pages, 8 figures