JM3D 与 JM3D-LLM:借助联合多模态线索提升三维理解
计算机视觉与模式识别
2024-01-26 v3
摘要
三维理解在计算机视觉、自动驾驶与机器人领域中至关重要,其重要性日益凸显。然而,当前主流做法直接将二维对齐策略迁移至三维领域,面临三个显著挑战:(1)信息退化:源于三维数据仅与单视图二维图像和通用文本对齐,忽视了多视图图像与细分子类文本的需求。(2)协同不足:这些策略将三维表示分别与图像和文本特征对齐,阻碍了三维模型的整体优化。(3)利用不充分:所学表示中固有的细粒度信息常未被充分利用,意味着细节的潜在损失。为解决这些问题,我们提出 JM3D,一种融合点云、文本与图像的综合方法。关键贡献包括结构化多模态组织器(SMO),以多视图与层次化文本丰富视觉-语言表示;以及联合多模态对齐(JMA),将语言理解于视觉表示相结合。我们的进阶模型 JM3D-LLM 通过高效微调将三维表示与大语言模型结合。在 ModelNet40 与 ScanObjectNN 上的评估确立了 JM3D 的优越性。JM3D-LLM 的卓越性能进一步印证了我们表示迁移方法的有效性。我们的代码与模型见 https://github.com/Mr-Neko/JM3D。
引用
@article{arxiv.2310.09503,
title = {JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues},
author = {Jiayi Ji and Haowei Wang and Changli Wu and Yiwei Ma and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2310.09503},
year = {2024}
}
备注
16 pages, 4 figures, 10 tables, 3D understanding