中文

用于人机交互的单目3D目标位置估计

计算机视觉与模式识别 2026-03-03 v1 人工智能 人机交互 机器学习 机器人学

摘要

预训练的通用视觉语言模型(Vision-Language Model, VLM)因其丰富的世界知识和2D目标检测能力,具有提升直观人机交互的潜力。然而,针对3D坐标检测任务的VLM鲜有出现。在本工作中,我们通过返回给定单目RGB图像(来自腕部相机)、自然语言输入和机器人状态下的3D目标位置,来探索VLM的交互能力。我们收集并精心策划了超过100,000张图像的异构数据集,并使用QLoRA和自定义回归头对VLM进行微调。通过实施条件路由,我们的模型在保持处理一般视觉查询能力的同时,添加了专门的3D位置估计功能。我们的结果表明,在测试集上模型预测性能稳健,中位数平均绝对误差(median MAE)为13 mm,且相对于未微调的简单基线实现了五倍改进。在约25%的情况下,预测值在机器人与物体交互时所需的可接受范围内。

关键词

引用

@article{arxiv.2603.01224,
  title  = {Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction},
  author = {Ari Wahl and Dorian Gawlinski and David Przewozny and Paul Chojecki and Felix Bießmann and Sebastian Bosse},
  journal= {arXiv preprint arXiv:2603.01224},
  year   = {2026}
}

备注

Accepted at Workshop on Integrating Image Processing with Large-Scale Language/Vision Models for Advanced Visual Understanding (LVLM) at IEEE International Conference on Image Processing (ICIP) 2025