中文

TREB:用于表格数据插值的 BERT 方法

机器学习 2024-10-02 v1

摘要

TREB 是一种新颖的表格插值框架,利用 BERT,提出了处理表格数据中缺失值的创新方法。与许多传统方法忽视插值特定需求不同,TREB 利用 BERT 的强大能力来解决这一关键任务。虽然许多针对表格数据的 BERT 方法已涌现,但它们经常未充分利用语言模型的全部潜力。为纠正这一点,TREB 采用专为插值表格数据集中实数值连续数字而微调的 BERT-based 模型。论文全面地论述了表格数据插值的独特挑战,强调基于上下文的相互关联性的重要性。通过对加州房价数据集进行严格评估,验证了 TREB 的有效性。结果表明,它能够保持特征之间的相互关系并准确插值缺失值。此外,作者阐明了 TREB 的计算效率和环境影响,量化了其训练和部署相关的浮点运算 (FLOPs) 和碳足迹。

关键词

引用

@article{arxiv.2410.00022,
  title  = {TREB: a BERT attempt for imputing tabular data imputation},
  author = {Shuyue Wang and Wenjun Zhou and Han drk-m-s Jiang and Shuo Wang and Ren Zheng},
  journal= {arXiv preprint arXiv:2410.00022},
  year   = {2024}
}

备注

12 pages, 7 figures