中文

文本嵌入模型可作为优秀数据工程师

机器学习 2025-05-22 v1

摘要

数据工程管道是必不可少的——尽管成本高昂——预测分析框架的组成部分,需要大量的工程时间和领域专业知识来完成诸如数据摄取、预处理、特征提取和特征工程等任务。本文提出了 ADEPT,一个通过文本嵌入实现的自动化数据工程管道。ADEPT 框架的核心是一个简单而强大的想法:与时间序列的文本密集型原始格式表示对应的嵌入熵,直观地可以视为等同于(在许多情况下甚至优于)由数据工程管道获得的数值稠密向量表示的熵。因此,ADEPT 使用两步方法:(i)利用文本嵌入表示多样化的数据源,(ii)构建变分信息瓶颈准则来缓解时间序列数据文本嵌入的熵方差。ADEPT 提供了一个端到端的自动化预测模型实现,尽管存在缺失数据、格式错误的记录、不proper 或损坏的数据格式以及不规则时间戳等问题,仍能提供优异的预测性能。通过详尽的实验,我们展示了 ADEPT 在来自医疗保健、金融、科学和工业物联网等大规模应用领域的多样数据集上超越了最佳现有基准。我们的结果表明,ADEPT 有望跨越许多传统数据管道步骤,从而为多样化的数据科学应用铺设出高效且可扩展的自动化路径。

关键词

引用

@article{arxiv.2505.14802,
  title  = {Text embedding models can be great data engineers},
  author = {Iman Kazemian and Paritosh Ramanan and Murat Yildirim},
  journal= {arXiv preprint arXiv:2505.14802},
  year   = {2025}
}