OmniBind:教会构建不等尺度模态交互以实现全绑定
计算机视觉与模式识别
2024-05-28 v1
摘要
多模态学习的研究主要在训练时将模态对齐到统一空间,推理时仅取单一模态进行预测。然而,对于真实机器(例如机器人),传感器可能随时添加或移除。因此,使机器能够处理训练和推理之间模态组合的不匹配和不等尺度问题至关重要。本文从一个新视角解决这些问题:“模态帮助模态”。直观地,我们提出了OmniBind,一种新颖的两阶段学习框架,可以实现任意模态组合和交互。它涉及教导数据受限(即学生)模态与训练充分的数据丰富(即教师)模态对齐。这巧妙地实现了任意模态的自适应融合,为任意组合构建统一表示空间。具体来说,我们提出了跨模态对齐蒸馏(CAD)来解决学生和教师模态之间的不等尺度问题,并在第一阶段有效地将学生模态对齐到教师模态的表示空间中。然后,我们提出了自适应融合(AF)模块,以融合任意模态组合并在第二阶段学习统一表示空间。为了解决不匹配问题,我们聚合现有数据集,并通过相同语义组合来自不同模态的样本。这样,我们构建了第一个用于训练和评估的数据集,包含教师(图像、文本)和学生(触觉、热感、事件、点云、音频)模态,并实现了任意模态的全绑定。在识别任务上的大量实验表明,在任意模态组合设置下,性能平均比先前方法提高4.05%。它还在单一模态(例如触觉)上实现了最先进的性能,增益为4.34%。
引用
@article{arxiv.2405.16108,
title = {OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All},
author = {Yuanhuiyi Lyu and Xu Zheng and Dahun Kim and Lin Wang},
journal= {arXiv preprint arXiv:2405.16108},
year = {2024}
}