中文

神经网络在通用多模态推理中的泛化能力

机器学习 2024-03-05 v2

摘要

Transformer的出现导致了大型语言模型(LLM)的发展,这些模型似乎展现出类似人类的能力。为了评估这类模型以及各种其他基础神经网络架构在多模态领域的通用性,我们评估并比较了它们的多模态泛化能力。我们引入了一个多模态问答基准,以评估三种特定类型的分布外(OOD)泛化性能:干扰物泛化(存在干扰物时的泛化)、系统性组合泛化(对新任务排列的泛化)以及生产性组合泛化(对更复杂任务结构的泛化)。我们发现,在各种模型架构(例如RNN、Transformer、Perceiver等)中,具有多个注意力层的模型,或者利用输入域之间交叉注意力机制的模型,表现更好。我们的积极结果表明,对于多模态干扰物和系统性泛化,跨模态注意力或具有更深注意力层的模型是整合多模态输入所需的关键架构特征。另一方面,这些架构特征都没有导致生产性泛化,这表明现有架构在特定类型的多模态泛化方面存在根本性限制。这些结果展示了现代神经模型用于多模态推理的特定架构组件的优势和局限性。最后,我们提供了Generic COG(gCOG),一个具有多个多模态泛化分割的可配置基准,供未来研究探索。

关键词

引用

@article{arxiv.2401.15030,
  title  = {On the generalization capacity of neural networks during generic multimodal reasoning},
  author = {Takuya Ito and Soham Dan and Mattia Rigotti and James Kozloski and Murray Campbell},
  journal= {arXiv preprint arXiv:2401.15030},
  year   = {2024}
}

备注

ICLR 2024