从含系统性缺失值的数据中进行贪婪结构学习
机器学习
2022-05-23 v3
摘要
从含缺失值的数据中学习是许多领域的常见现象。较少有贝叶斯网络结构学习算法考虑缺失数据,而那些考虑的算法往往依赖于假设缺失数据为随机缺失的标准方法,例如期望最大化(Expectation-Maximisation)算法。由于缺失数据常常是系统性的,因此需要更务实的方法,能够有效处理含非随机缺失值的数据集。缺乏处理系统性缺失数据的方法阻碍了BN结构学习方法在缺失非随机的真实世界问题中的应用。本文描述了贪婪搜索结构学习的三种变体,其利用成对删除与逆概率加权来最大化利用观测数据并限制由缺失值引起的潜在偏差。前两种变体可视为第三种也是性能最佳变体的子版本,但本身对于展示学习精度上的逐步改进具有重要意义。实证研究表明,所提方法在随机缺失与非随机缺失情况下,无论在学习精度还是效率上均优于常用的且最先进的Structural EM算法。
引用
@article{arxiv.2107.04184,
title = {Greedy structure learning from data that contain systematic missing values},
author = {Yang Liu and Anthony C. Constantinou},
journal= {arXiv preprint arXiv:2107.04184},
year = {2022}
}