中文

深度表格表示纠正器

机器学习 2026-03-18 v1

摘要

表格数据在医疗、工程、金融等众多实际领域发挥着重要作用。深度学习的成功推动了众多基于 Transformer、ResNet 等深度网络的表格学习方法的涌现。一般而言,现有的深度表格机器学习方法主要遵循两种范式,即基于学习中的方法和基于预学习的方法。基于学习中的方法需要从头训练网络或施加额外约束来调节表示,但这些网络需要同时训练多个任务,导致学习更加困难;而基于预学习的方法则设计若干预置任务进行预训练,然后进行特定任务的微调,但需要额外的训练工作并依赖先验知识。本文提出一种新型深度表格表示纠正器 (TRC),以无需修改原有参数的方式在模型无关方面增强任何已训练的深度表格模型的表示。具体而言,针对阻碍预测的表示偏移和表示冗余问题,本文提出两种任务,即 (i) 表格表示重新估计:通过训练偏移估计器计算表格表示的固有偏移,以此减轻偏移,从而重新估计表示;以及 (ii) 表格空间映射:将上述重新估计的表示转换为轻量级嵌入向量空间,同时保留关键预测信息以最小化冗余。这两个任务共同增强了深度表格模型的表示,而无需触及原始模型,从而具有高效优势。最后,我们在多个表格基准数据集上对 state-of-the-art 深度表格机器学习模型与 TRC 进行了大规模实验,结果表明该方法始终优于现有方法。

关键词

引用

@article{arxiv.2603.16569,
  title  = {Deep Tabular Representation Corrector},
  author = {Hangting Ye and Peng Wang and Wei Fan and Xiaozhuang Song and He Zhao and Dandan Gun and Yi Chang},
  journal= {arXiv preprint arXiv:2603.16569},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)