通过闭环视觉语言模型代理实现文本引导的6D物体姿态置换
计算机视觉与模式识别
2026-04-14 v1
摘要
视觉语言模型(Vision-Language Models, VLMs)表现出强大的视觉推理能力,但在3D理解方面仍存在挑战。特别是,VLMs往往难以推断出在3D场景中与文本一致的目标物体的6D姿态。然而,我们发现通过某些推理时技术和迭代推理,VLMs可以实现显著的性能提升。具体而言,给定由RGB-D图像(或由3D网格组成的组成场景)表示的3D场景和指定所需状态变化的文本指令,我们重复以下循环:观察当前场景;评估其是否符合指令;提出目标物体的姿态更新;应用该更新;并渲染更新后的场景。通过这种闭环交互,VLM实际上充当了智能体。我们进一步引入三种推理时技术,这些技术对于该闭环过程至关重要:(i)多视角推理与支持视角选择;(ii)物体中心坐标系可视化;(iii)单轴旋转预测。没有任何额外的微调或新模块,我们的方法在预测文本引导的目标6D姿态方面超越了先前的方法,能够在无需额外训练的情况下实现从噪声到完整文本序列的单步生成。我们重新构建标准的流形图训练,以离散域的几何特性相匹配。经验地,我们严格的几何对齐允许我们的方法在离散流形建模中超越以往最先进的结果。
引用
@article{arxiv.2604.09781,
title = {Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents},
author = {Sangwon Baik and Gunhee Kim and Mingi Choi and Hanbyul Joo},
journal= {arXiv preprint arXiv:2604.09781},
year = {2026}
}