SFHand:通过流式式三维手部预测学习具身操作
计算机视觉与模式识别
2026-05-18 v2
摘要
实时三维手部预测是实现AR和助助机器人等应用中流畅的人机交互的关键组件。然而,现有方法不适用于此类场景,通常需要离线访问累积的视频序列,无法融合传递任务意图意图的语言指导。为克服这些限制,我们引入SFHand——首个面向语言引导的三维手部预测流式框架。SFHand从连续的视频流和语言指令中,自回归地预测未来一系列完整的三维手部状态,包括手类型、二维边界框、三维姿态和轨迹。我们的框架结合了流式自回归架构与增强感兴趣区域(ROI)的记忆层,既捕获时序上下文,又聚焦于手部相关的关键区域。为支持本研究,我们还引入EgoHaFL——首个包含同步三维手部姿态与语言指令的大规模数据集。我们展示,SFHand在三维手部预测方面实现了新的状态突破,净载结果相较于先前工作提升了最高可达35.8%。此外,我们展示所学表示在下游具身操作任务中的实际效用,通过迁移学习,在多个基准测试中提升了最高可达13.4%的任务成功率。数据集页面:https://huggingface.co/datasets/ut-vision/EgoHaFL,项目页面:https://github.com/ut-vision/SFHand。
关键词
引用
@article{arxiv.2511.18127,
title = {SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting},
author = {Ruicong Liu and Yifei Huang and Liangyang Ouyang and Caixin Kang and Yoichi Sato},
journal= {arXiv preprint arXiv:2511.18127},
year = {2026}
}