TIP:基于表格-图像预训练的多模态分类方法以应对数据不完整
计算机视觉与模式识别
2024-07-11 v1
摘要
图像和结构化表格是真实数据库中的重要组成部分。尽管表格-图像表征学习前景广阔,但仍面临挑战,因为表格数据通常具有异构性和不完整性,呈现出显著的模态差异。此前工作主要关注完整数据情景下的简单模态融合策略,未能实际应对缺失数据问题。本文提出TIP,一种面向不完整表格数据的多模态表征学习框架。具体而言,TIP探索一种新颖的自监督学习策略,包括掩码表格重建任务用于处理数据缺失,以及图像-表格匹配和对比学习目标以捕获多模态信息。此外,TIP设计了针对不完整异构表格数据的通用表格编码器,以及用于跨模态表征学习的多模态交互模块。实验在使用自然图像和医学图像数据集进行下游多模态分类任务。结果表明,TIP在完整和不完整数据情景下均优于现有领先的监督/自监督图像/多模态算法。我们的代码已公开于https://github.com/siyi-wind/TIP。
引用
@article{arxiv.2407.07582,
title = {TIP: Tabular-Image Pre-training for Multimodal Classification with Incomplete Data},
author = {Siyi Du and Shaoming Zheng and Yinsong Wang and Wenjia Bai and Declan P. O'Regan and Chen Qin},
journal= {arXiv preprint arXiv:2407.07582},
year = {2024}
}
备注
28 pages (including 9 pages of supplementary materials), accepted by ECCV 2024