中文

面向带文本的表格数据的基准模型

机器学习 2025-07-11 v1

摘要

表格数据的基础模型正快速发展,日益关注将其扩展以支持额外的模态,如自由文本特征。然而,现有的表格数据基准测试很少包含文本列,而且寻找具有语义丰富文本特征的真实世界表格数据集并不容易。我们提出了一系列简单而有效的消融式策略,用于将文本集成到传统表格管道中。此外,我们通过手动挑选包含有意义文本特征的真实世界表格数据集集合,对现有表格基础模型处理文本数据进行基准测试。我们的研究是提升表格数据基础模型文本处理基准测试的重要一步。

关键词

引用

@article{arxiv.2507.07829,
  title  = {Towards Benchmarking Foundation Models for Tabular Data With Text},
  author = {Martin Mráz and Breenda Das and Anshul Gupta and Lennart Purucker and Frank Hutter},
  journal= {arXiv preprint arXiv:2507.07829},
  year   = {2025}
}

备注

Accepted at Foundation Models for Structured Data workshop at ICML 2025