中文

面向关系数据的信息论预训练框架

机器学习 2026-02-02 v2 人工智能

摘要

关系数据库支撑着广泛领域的关键基础设施,然而由于任务异构性,设计可泛化的关系数据库预训练策略仍是一项开放挑战。具体而言,下游任务种类繁多,因为任务是基于关系模式图、时间依赖以及 SQL 定义的标签逻辑来定义的。一个有效的预训练框架需要综合考虑这些因素,以获得任务感知的表示。通过引入驱动标签生成的底层分布的相关知识,下游任务可以受益于相关的旁路信息。为弥合这一差距,我们提出了任务向量估计(TVE),一种新颖的预训练框架,它通过基于集合的聚合在模式遍历图上构建预测性监督信号,显式建模下一窗口的关系动力学。我们从信息论视角对该方法进行了形式化分析,证明融入任务先验的表示比未融入任务先验的表示保留了更多相关信号。在 RelBench 基准上的大量实验表明,TVE 始终优于传统预训练基线。我们的研究结果倡导将任务异构性与时间结构作为关系数据库预测建模的设计原则纳入预训练目标。代码已公开:https://github.com/quang-truong/task-vector-estimation。

关键词

引用

@article{arxiv.2507.09837,
  title  = {A Pre-training Framework for Relational Data with Information-theoretic Principles},
  author = {Quang Truong and Zhikai Chen and Mingxuan Ju and Tong Zhao and Neil Shah and Jiliang Tang},
  journal= {arXiv preprint arXiv:2507.09837},
  year   = {2026}
}

备注

NeurIPS'25