中文

CL3DOR:基于高分辨率点云比值率的3D大多模态模型对比学习

计算机视觉与模式识别 2025-01-08 v1 人工智能

摘要

最近的研究表明,大语言模型(LLM)不仅限于文本任务,还能在包括音频、图像和视频等多种模态上作为多模态模型发挥作用。特别是针对3D大型多模态模型(3D LMM)的研究正因处理更高维数据(如点云)的潜力而取得显著进展。然而,仔细检查后发现,现有训练数据集中每个样本的视觉和文本内容缺乏足够的信息细粒度和清晰度,这成为精准跨模态理解的瓶颈。为解决这些问题,我们提出了CL3DOR(Contrastive Learning for 3D large multimodal models via Odds ratio on high-Resolution point clouds),旨在确保视觉和文本内容的更高具体性和清晰度。具体而言,我们增加了每个物体的点云密度,并构建训练数据集中的信息性硬负样本以惩罚不希望的响应。为利用硬负样本,我们将比值率(odds ratio)作为对比学习的辅助项纳入常规语言模型损失。CL3DOR在3D场景理解和推理基准测试中实现了最先进的性能。此外,我们通过大量实验展示了CL3DOR各关键组件的有效性。

关键词

引用

@article{arxiv.2501.03879,
  title  = {CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds},
  author = {Keonwoo Kim and Yeongjae Cho and Taebaek Hwang and Minsoo Jo and Sangdo Han},
  journal= {arXiv preprint arXiv:2501.03879},
  year   = {2025}
}