连续变量贪婪因果搜索的规模化扩展
人工智能
2015-11-13 v2
摘要
正如在R或Tetrad程序中标准实现的那样,科学家最广泛或最有效使用的因果搜索算法存在严重的维度限制,使其在不牺牲准确性的情况下不适用于大数据问题。然而,实现上的改进是可能的。我们探索了贪婪等价搜索(Greedy Equivalence Search)的优化,使得在四处理器、16G内存的笔记本电脑上,对于具有1000个样本的稀疏模型,可在13分钟内搜索50,000个变量的问题。我们在匹兹堡超级计算中心的超级计算机节点(40个处理器、384G内存)上,对于稀疏模型,用18小时完成了具有1000个样本、1,000,000个变量规模的问题。同一算法也可应用于离散数据,但使用较慢的离散评分,尽管在我们的实验中离散实现目前扩展性不佳;我们已成功将稀疏模型下具有1000个样本的问题扩展到约10,000个变量。
引用
@article{arxiv.1507.07749,
title = {Scaling up Greedy Causal Search for Continuous Variables},
author = {Joseph D. Ramsey},
journal= {arXiv preprint arXiv:1507.07749},
year = {2015}
}
备注
12 pages, 2 figures, tech report for Center for Causal Discovery