面向带文本的表格数据的基准模型
机器学习
2025-07-11 v1
摘要
表格数据的基础模型正快速发展,日益关注将其扩展以支持额外的模态,如自由文本特征。然而,现有的表格数据基准测试很少包含文本列,而且寻找具有语义丰富文本特征的真实世界表格数据集并不容易。我们提出了一系列简单而有效的消融式策略,用于将文本集成到传统表格管道中。此外,我们通过手动挑选包含有意义文本特征的真实世界表格数据集集合,对现有表格基础模型处理文本数据进行基准测试。我们的研究是提升表格数据基础模型文本处理基准测试的重要一步。
引用
@article{arxiv.2507.07829,
title = {Towards Benchmarking Foundation Models for Tabular Data With Text},
author = {Martin Mráz and Breenda Das and Anshul Gupta and Lennart Purucker and Frank Hutter},
journal= {arXiv preprint arXiv:2507.07829},
year = {2025}
}
备注
Accepted at Foundation Models for Structured Data workshop at ICML 2025