中文

LANISTR:基于结构化与非结构化数据的多模态学习

机器学习 2024-04-25 v3 人工智能

摘要

多模态大规模预训练在非结构化数据(如语言和图像)上已展现出令人印象深刻的性能。然而,一个普遍存在的现实场景涉及结构化数据类型(表格数据和时间序列)以及非结构化数据。此类场景一直未得到充分研究。为弥补这一差距,我们提出 LANISTR,一种基于注意力的框架,用于从语言(LANguage)、图像(Image)和结构化(STRuctured)数据中学习。LANISTR 方法的核心根植于应用于单模态和多模态层面的基于掩码(masking-based)的训练。特别地,我们引入了一种新的基于相似度的多模态掩码损失,使其能够从具有缺失模态的大规模多模态数据中学习跨模态关系。在两个真实世界数据集(来自医疗健康的 MIMIC-IV 和来自零售的 Amazon Product Review)上,LANISTR 分别在使用 0.1% 和 0.01% 标注数据微调时,相较于最先进的替代方案展现出显著改进,AUROC 提升 6.6%,准确率提升 14%。值得注意的是,即使在极高比例样本(分别为 35.7% 和 99.8%)不包含全部模态的情况下,这些改进依然可见,凸显了 LANISTR 对实际缺失模态挑战的鲁棒性。我们的代码和模型将发布于 https://github.com/google-research/lanistr

关键词

引用

@article{arxiv.2305.16556,
  title  = {LANISTR: Multimodal Learning from Structured and Unstructured Data},
  author = {Sayna Ebrahimi and Sercan O. Arik and Yihe Dong and Tomas Pfister},
  journal= {arXiv preprint arXiv:2305.16556},
  year   = {2024}
}