BlockEcho:用于插值块状缺失数据的长程依赖保持方法
机器学习
2024-03-01 v1 机器学习
摘要
块状缺失数据在实际数据插值任务中提出了显著挑战。相较于分散缺失数据,块状缺失会加剧对后续分析和机器学习任务的不利影响,因为缺乏局部相邻元素显著降低了插值能力和预测能力。然而,此问题未得到充分关注。大多数SOTA矩阵完成方法效果较差,主要due于过度依赖相邻元素进行预测。我们系统性地分析了这一问题,提出一种新型矩阵完成方法“BlockEcho”以提供更全面的解决方案。该方法创造性地将矩阵分解(MF)集成到生成对抗网络(GAN)中,显式保留原始矩阵中元素之间的长距离关系。此外,我们引入额外的判别器,用于GAN,比较生成器的中间进度与预训练的MF结果,以约束高阶特征分布。随后,我们在三个领域的公开数据集上评估了BlockEcho。结果表明,在插值块状缺失数据方面,BlockEcho在性能上优于传统方法和SOTA方法,尤其在缺失率较高时表现更为突出。该优势在缺失率较高的散布式缺失数据插值中同样适用。我们还在理论上对将MF和GAN融合用于块状缺失数据的最优性和收敛性提供了依据。
引用
@article{arxiv.2402.18800,
title = {BlockEcho: Retaining Long-Range Dependencies for Imputing Block-Wise Missing Data},
author = {Qiao Han and Mingqian Li and Yao Yang and Yiteng Zhai},
journal= {arXiv preprint arXiv:2402.18800},
year = {2024}
}