中文

基于个体模型的缺失值填补学习(技术报告)

数据库 2020-04-08 v1 机器学习

摘要

数值型缺失值十分普遍,例如由于传感器读数不可靠、异构源之间的采集与传输所致。与有限域上的分类数据填补不同,数值型缺失值面临两个问题:(1) 稀疏性问题,由于(近乎)无限的定义域,不完整元组可能没有足够的完整邻居共享相同/相似值用于填补;(2) 异构性问题,不同元组可能并不适配同一(回归)模型。在本研究中,受仅在某些元组上而非整个关系上成立的条件依赖关系启发,我们提出为每个完整元组及其邻居单独学习一个回归模型。我们的 IIM(Imputation via Individual Models,基于个体模型的填补)因此不再依赖 k 个完整邻居之间共享相似值来进行填补,而是利用前述学习的个体(不必相同)模型所得的回归结果。值得注意的是,我们表明在个体学习所考虑的邻居数 l 的极端设置下,一些现有方法确实是我们 IIM 的特例。从这个意义上说,合适的邻居数 l 对于学习个体模型(避免过拟合或欠拟合)至关重要。我们提出针对不同完整元组在多种邻居数 l 上自适应地学习个体模型。通过设计高效的增量计算,学习一个模型的时间复杂度从线性降为常量。在真实数据上的实验表明,采用自适应学习的 IIM 比现有方法取得了更高的填补精度。

关键词

引用

@article{arxiv.2004.03436,
  title  = {Learning Individual Models for Imputation (Technical Report)},
  author = {Aoqian Zhang and Shaoxu Song and Yu Sun and Jianmin Wang},
  journal= {arXiv preprint arXiv:2004.03436},
  year   = {2020}
}