S-Omninet:结构化数据增强的通用多模态学习架构
计算机视觉与模式识别
2023-07-04 v1 机器学习
摘要
近年来,多模态多任务学习引起了越来越多的关注。单模态模型发展迅速,并在多个领域的各种任务上取得了令人惊叹的结果。多模态学习通过整合来自多种模态的数据,为进一步改进提供了机会。许多方法被提出用于学习特定类型的多模态数据,例如视觉与语言数据。其中少数方法被设计用于同时处理多种模态与任务。在这项工作中,我们通过引入跨缓存注意力、整合视觉输入的块嵌入以及支持结构化数据,对能够同时处理多种模态与任务的架构 Omninet 进行了扩展与改进。所提出的结构化数据增强 Omninet(S-Omninet)是一种通用模型,能够通过跨缓存注意力有效地从各种维度的结构化数据与非结构化数据中学习,从而实现空间、时间与结构化特征之间的交互。我们还利用块嵌入增强了空间缓存中的空间表示。我们在多个多模态数据集上评估了所提出的模型,并展示出相对于基线 Omninet 的显著改进。
引用
@article{arxiv.2307.00226,
title = {S-Omninet: Structured Data Enhanced Universal Multimodal Learning Architecture},
author = {Ye Xue and Diego Klabjan and Jean Utke},
journal= {arXiv preprint arXiv:2307.00226},
year = {2023}
}