面向表格数据插值的比例遮蔽自编码器:预测或不预测?
机器学习
2024-12-30 v1 人工智能
机器学习
摘要
遮蔽自编码器(MAEs)最近在表格数据插值方面显示出良好的效果。然而,由于表格数据的本质异质性,常用的均匀随机遮蔽策略会破坏缺失性分布,导致性能次优。为此,我们提出一种比例遮蔽策略。具体地,我们首先根据数据集中观察到的缺失比例计算缺失性统计信息,然后生成与这些统计信息相匹配的遮蔽掩码,以确保遮蔽后缺失性分布得到保持。此外,我们认为简单的 MLP 基于标记的混合方法在注意力机制方面往往能提供竞争或更佳的性能,尤其是在表格领域,因为其内在的异质性。实验结果验证了在各种缺失数据模式下,所提出的比例遮蔽策略的有效性。代码可在 \url{https://github.com/normal-kim/PMAE} 获取。
引用
@article{arxiv.2412.19152,
title = {To Predict or Not To Predict? Proportionally Masked Autoencoders for Tabular Data Imputation},
author = {Jungkyu Kim and Kibok Lee and Taeyoung Park},
journal= {arXiv preprint arXiv:2412.19152},
year = {2024}
}