TAIHRI:面向近距离人机交互的任务感知3D人体关键点定位
计算机视觉与模式识别
2026-04-13 v1
摘要
准确的3D人体关键点定位是实现机器人自然安全物理交互的关键技术。传统的3D人体关键点估计方法主要关注相对于根关节的整体身体重建质量。然而,在实际的人机交互(HRI)场景中,机器人更关心在以用户为中心的摄像头3D坐标下,针对特定任务的关键身体部位的精确度量尺度空间定位。我们提出TAIHRI,是首个为近距离HRI感知设计的Vision-Language Model(VLM),能够理解用户的动作指令并引导机器人注意力聚焦于最具任务相关性的关键点。通过将3D关键点量化为有限的交互空间,TAIHRI通过2D关键点推理实现对关键身体部位3D空间坐标的精确定位,并能无缝适配自然语言控制或全局空间人体网格恢复等下游任务。实验在以用户为中心的交互基准数据集上表明,TAIHRI在任务关键部位实现了卓越的估计精度。我们认为TAIHRI为具身化人机交互领域开辟了新的研究方向。代码已公开:https://github.com/Tencent/TAIHRI。
关键词
引用
@article{arxiv.2604.08921,
title = {TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction},
author = {Ao Li and Yonggen Ling and Yiyang Lin and Yuji Wang and Yong Deng and Yansong Tang},
journal= {arXiv preprint arXiv:2604.08921},
year = {2026}
}