代码与像素:多模态对比预训练增强表格数据分析
计算机视觉与模式识别
2025-01-14 v1 机器学习
摘要
从表格数据中学习至关重要,因为它通过提供丰富的结构化信息补充了传统的图像和视频数据分析,这些信息通常对于全面理解和决策过程至关重要。我们提出了多任务对比掩码表格建模(MT-CMTM),一种旨在通过利用表格数据与对应图像之间的相关性来增强表格模型的新方法。MT-CMTM采用双重策略,结合对比学习与掩码表格建模,优化这些数据模态之间的协同作用。我们方法的核心是一个带有残差连接和注意力机制的一维卷积神经网络(1D-ResNet-CBAM),旨在无需依赖图像即可高效处理表格数据。这使得MT-CMTM能够处理纯表格数据用于下游任务,消除了潜在昂贵的图像获取和处理需求。我们在DVM汽车数据集(特别适合此场景)和新开发的HIPMP数据集(连接膜制造参数与图像数据)上评估了MT-CMTM。我们的MT-CMTM模型优于从头训练的表格1D-ResNet-CBAM,在HIPMP上相对MSE提升了1.48%,在DVM上绝对准确率提升了2.38%。这些结果证明了MT-CMTM的鲁棒性及其推动多模态学习领域发展的潜力。
引用
@article{arxiv.2501.07304,
title = {Code and Pixels: Multi-Modal Contrastive Pre-training for Enhanced Tabular Data Analysis},
author = {Kankana Roy and Lars Krämer and Sebastian Domaschke and Malik Haris and Roland Aydin and Fabian Isensee and Martin Held},
journal= {arXiv preprint arXiv:2501.07304},
year = {2025}
}