用于人机交互的单目3D目标位置估计
计算机视觉与模式识别
2026-03-03 v1 人工智能
人机交互
机器学习
机器人学
摘要
预训练的通用视觉语言模型(Vision-Language Model, VLM)因其丰富的世界知识和2D目标检测能力,具有提升直观人机交互的潜力。然而,针对3D坐标检测任务的VLM鲜有出现。在本工作中,我们通过返回给定单目RGB图像(来自腕部相机)、自然语言输入和机器人状态下的3D目标位置,来探索VLM的交互能力。我们收集并精心策划了超过100,000张图像的异构数据集,并使用QLoRA和自定义回归头对VLM进行微调。通过实施条件路由,我们的模型在保持处理一般视觉查询能力的同时,添加了专门的3D位置估计功能。我们的结果表明,在测试集上模型预测性能稳健,中位数平均绝对误差(median MAE)为13 mm,且相对于未微调的简单基线实现了五倍改进。在约25%的情况下,预测值在机器人与物体交互时所需的可接受范围内。
引用
@article{arxiv.2603.01224,
title = {Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction},
author = {Ari Wahl and Dorian Gawlinski and David Przewozny and Paul Chojecki and Felix Bießmann and Sebastian Bosse},
journal= {arXiv preprint arXiv:2603.01224},
year = {2026}
}
备注
Accepted at Workshop on Integrating Image Processing with Large-Scale Language/Vision Models for Advanced Visual Understanding (LVLM) at IEEE International Conference on Image Processing (ICIP) 2025