中文

PhotoAgent:具备空间与审美理解能力的机器人摄影师

计算机视觉与模式识别 2026-03-25 v1 人工智能 机器人学

摘要

对于需要在高层语言命令与几何控制之间搭建语义鸿沟的创意任务(如摄影),具身智能体必须实现这一目标。我们提出 PhotoAgent,通过整合大型多模态模型(LMM)推理与一种新颖的控制范式来实现这一目标。PhotoAgent 首先通过 LMM 驱动的链式思考(CoT)推理,将主观的审美目标转化为可求解的几何约束,使分析求解器能够计算出高质量的初始视点。随后,该初始姿态通过内置于 3D 高斯溶解(3DGS)的逼真三维世界模型中的视觉反思进行迭代细化。这种“心理模拟”取代了昂贵且缓慢的物理试错,使快速收敛至更优异的审美结果成为可能。评估结果表明,PhotoAgent 在空间推理方面表现出色,并实现了优异的最终图像质量。

关键词

引用

@article{arxiv.2603.22796,
  title  = {PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding},
  author = {Lirong Che and Zhenfeng Gan and Yanbo Chen and Junbo Tan and Xueqian Wang},
  journal= {arXiv preprint arXiv:2603.22796},
  year   = {2026}
}

备注

Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026