中文

基于高阶消息传递的 LLM 增强混合类型数据插值

机器学习 2025-01-07 v1 社会与信息网络

摘要

缺失数据插值旨在对原始数据集中的缺失值进行插值,以实现数据集的完整性,这对于像大型语言模型(LLM)这样的数据驱动模型至关重要,并且在过去的几十年里受到日益关注的注意。尽管如此,现有的缺失数据插值解决方案要么仅支持数值和类别数据,要么由于设计时侧重于文本数据且缺乏表格数据插值所需的关键属性,导致性能不令人满意。本文提出了 UnIMP,一个统一的 IMPutation 框架,利用 LLM 和高阶消息传递来增强对包括数值、类别和文本数据在内的混合类型数据的插值。具体而言,我们首先引入细胞导向的超图来对表格进行建模。随后我们提出了 BiHMP,即高效的双向高阶消息传递网络,用于在构建的超图上聚合全局-局部信息和高阶关系,同时捕捉列之间的异质性和列内同质性。为了有效且高效地对齐 LLM 的容量与 BiHMP 收集的信息,我们引入了 Xfusion,其与 BiHMP 一起作为 LLM 的适配器。我们遵循预训练和微调管线来训练 UnIMP,集成了两种优化:一种是分块技术,将表格划分为更小的块以提高效率;另一种是渐进式遮蔽技术,使模型逐渐适应学习更复杂的数据模式。理论证明和在 10 个真实数据集上的实验都凸显了 UnIMP 相对于现有技术的优势。

关键词

引用

@article{arxiv.2501.02191,
  title  = {On LLM-Enhanced Mixed-Type Data Imputation with High-Order Message Passing},
  author = {Jianwei Wang and Kai Wang and Ying Zhang and Wenjie Zhang and Xiwei Xu and Xuemin Lin},
  journal= {arXiv preprint arXiv:2501.02191},
  year   = {2025}
}