中文

3D-Agent:用于可扩展 3D 对象标注的三模态多智能体协作

计算机视觉与模式识别 2026-01-09 v1 人工智能

摘要

受 autonomous driving robotics 和增强现实等应用驱动,3D 对象标注面临的挑战超越 2D 标注,包括空间复杂性、遮挡和视点不一致性。现有基于单一模型的方法往往难以有效解决这些问题。我们提出 Tri MARF,一种新框架,将三模态输入(包括 2D 多视角图像、文本描述和 3D 点云)集成到多智能体协作架构中,以增强大规模 3D 标注。Tri MARF 由三个专门的智能体组成:vision language model 智能体用于生成多视角描述,information aggregation 智能体用于选择最佳描述,以及 gating 智能体用于将文本语义与 3D 几何对齐以实现精细化标注。 extensive 实验表明,Tri MARF 在 Objaverse、LVIS、Objaverse XL 和 ABO 上显著优于现有方法,在 CLIPScore 上达到 88.7 分,ViLT R at 5 的检索准确率分别为 45.2% 和 43.8%,在单张 NVIDIA A100 GPU 上吞吐量可达每小时 12000 个对象。

关键词

引用

@article{arxiv.2601.04404,
  title  = {3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation},
  author = {Jusheng Zhang and Yijia Fan and Zimo Wen and Jian Wang and Keze Wang},
  journal= {arXiv preprint arXiv:2601.04404},
  year   = {2026}
}

备注

Accepted at NeurIPS 2025