中文

PhotoBot:基于自然语言的参考引导交互式摄影

计算机视觉与模式识别 2024-12-30 v4 人工智能 机器人学

摘要

我们介绍了 PhotoBot,这是一个基于高层人类语言指导与机器人摄影师之间交互的全自动照片采集框架。我们提出通过从精选图库中选取的参考图像向用户传达摄影建议。我们利用视觉语言模型(VLM)和目标检测器,通过文本描述来表征参考图像,然后使用大语言模型(LLM)通过基于文本的推理,根据用户的语言查询检索相关的参考图像。为了对应参考图像与观察到的场景,我们利用视觉 Transformer 的预训练特征,该特征能够捕捉跨显著外观变化的语义相似性。利用这些特征,我们通过求解透视 n 点(PnP)问题来计算 RGB-D 相机的建议姿态调整。我们使用配备腕部相机的机械臂演示了我们的方法。我们的用户研究表明,以人类反馈来衡量,PhotoBot 拍摄的照片通常比用户自己拍摄的照片在美学上更令人愉悦。我们还展示了 PhotoBot 能够泛化到其他参考源,例如绘画。

关键词

引用

@article{arxiv.2401.11061,
  title  = {PhotoBot: Reference-Guided Interactive Photography via Natural Language},
  author = {Oliver Limoyo and Jimmy Li and Dmitriy Rivkin and Jonathan Kelly and Gregory Dudek},
  journal= {arXiv preprint arXiv:2401.11061},
  year   = {2024}
}

备注

In Proceedings of the IEEE/RSJ International Conference on Intelligent Robotics and Systems (IROS'24), Abu Dhabi, UAE, Oct. 14-18, 2024