中文

LakeHopper:通过模型适应实现跨数据湖列类型注释

计算与语言 2026-02-10 v1 数据库

摘要

列类型注释对数据清洗、集成和可视化等任务至关重要。最近的解决方案依赖于资源密集型语言模型在特定表格集合(即源数据湖)中精选的列上进行微调。在本文中,我们研究是否可以适应现有的预训练基于语言模型的模型以适应到新的(即目标)数据湖,以最小化对新数据湖所需的注释。然而,挑战包括源-目标知识差距、选择信息丰富的目标数据以及在不损失共享知识的条件下进行微调。我们提出了 LakeHopper 框架,通过 LM 交互识别和解决知识差距,采用基于聚类的无注释列数据选择方案,并使用渐进式微调机制逐步适应源模型以适应目标数据湖。我们的实验结果在两种不同的模型迁移下,无论是在低资源还是高资源设置下,都验证了 LakeHopper 的有效性。

关键词

引用

@article{arxiv.2602.08793,
  title  = {LakeHopper: Cross Data Lakes Column Type Annotation through Model Adaptation},
  author = {Yushi Sun and Xujia Li and Nan Tang and Quanqing Xu and Chuanhui Yang and Lei Chen},
  journal= {arXiv preprint arXiv:2602.08793},
  year   = {2026}
}