基于部件-整体关系融合的多模态场景理解
计算机视觉与模式识别
2024-10-22 v1
摘要
多模态融合在多模态场景理解中发挥着关键作用。现有大多数方法专注于涉及两种模态的跨模态融合,往往忽视更复杂的多模态融合,这对于像自动驾驶这样的实际应用至关重要,其中会使用可见光、深度、事件、LiDAR 等多种模态。此外,少数针对多模态融合的尝试(例如简单拼接、跨模态注意力和token选择)无法充分挖掘多种模态的内在共享细节和特定细节。为应对这一挑战,本文提出了一种部件-整体关系融合(Part-Whole Relational Fusion, PWRF)框架。该框架首次将多模态融合视为部件-整体关系融合。它将多个单独的部件级模态通过胶囊网络(CapsNets)的部件-整体路由能力,路由到融合后的整体级模态。通过这种部件-整体路由,PWRF从整体级模态胶囊和路由系数中,分别生成模态共享语义和模态特定语义。随后,模态共享和模态特定细节可用于解决多模态场景理解问题,包括合成多模态分割和可见光-深度-热成像显著物体检测。实验表明,所提出的PWRF框架在多模态场景理解方面表现优异。源码已发布于 https://github.com/liuyi1989/PWRF。
引用
@article{arxiv.2410.14944,
title = {Part-Whole Relational Fusion Towards Multi-Modal Scene Understanding},
author = {Yi Liu and Chengxin Li and Shoukun Xu and Jungong Han},
journal= {arXiv preprint arXiv:2410.14944},
year = {2024}
}