3D-MoE: 基于矩形流的Mixture-of-Experts多模态LLM用于3D视觉与姿态扩散
计算与语言
2025-01-29 v1 计算机视觉与模式识别
机器人学
摘要
3D视觉和空间推理长期以来被认为对于准确感知我们所处的三维世界至关重要,尤其是相较于基于2D图像的传统视觉推理。由于收集高质量3D数据的困难,该领域的研究仅近年来才逐渐获得活跃度。随着强大语言模型(LLM)的出现,过去几年发展出了针对3D视觉的多模态LLM。然而,大多数模型主要聚焦于3D数据的视觉编码器。在本文中,我们提出将现有的密集激活LLM转换为基于Mixture-of-Experts(MoE)的模型,后者在多模态数据处理方面已证明有效。除了利用这些模型的指令跟随能力外,我们进一步通过附加一个采用新颖矩形流扩散调度器的扩散头(Pose-DiT)来实现具身任务规划。在3D问答和任务规划任务上的实验结果表明,我们的3D-MoE框架以更少的激活参数实现了 improved performance。
引用
@article{arxiv.2501.16698,
title = {3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow},
author = {Yueen Ma and Yuzheng Zhuang and Jianye Hao and Irwin King},
journal= {arXiv preprint arXiv:2501.16698},
year = {2025}
}
备注
Preprint. Work in progress