中文

3DrawAgent:利用早期对比经验教会 LLM 在 3D 中绘图

计算机视觉与模式识别 2026-04-10 v1 人工智能

摘要

在三维空间中绘图能够通过形状、结构和空间关系进行有表现力的推理,但通过自然语言生成 3D 草图仍是一大挑战。本文引入 3DrawAgent,一种无需训练的、语言驱动的 3D 草图生成框架,利用大语言模型(LLM)在几何反馈指导下逐步绘制 3D 贝塞尔曲线。不同于先前的 2D 草图智能体,我们的方法引入了相对经验优化策略,适配最近提出的 Group Reward Policy Optimization(GRPO)范式。该方法不依赖显式的ground-truth 监督,而是构建由生成草图对比组成的配对比较,每对中一半较好、一半较差,基于 CLIP 基于感知奖励和 LLM 基于细粒度定性评估。这些经验被用于迭代地细化模型对 3D 绘图的先验知识,从而在无参数更新的情况下实现对模型 3D 感知的强化学习。实验表明,3DrawAgent 能够从多样化的文本提示中生成复杂且连贯的 3D 贝塞尔草图,展现出涌现的几何推理能力,并能推广到新形状,开创了无需训练的 3D 草图智能领域的新范例。

关键词

引用

@article{arxiv.2604.08042,
  title  = {3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience},
  author = {Hongcan Xiao and Xinyue Xiao and Yilin Wang and Yue Zhang and Yonggang Qi},
  journal= {arXiv preprint arXiv:2604.08042},
  year   = {2026}
}

备注

CVPR 2026 Highlight