中文

RoboSubtaskNet:用于人机技能在真实环境中传递的时序子任务分割

机器人学 2026-02-12 v2 人工智能

摘要

在长时间未剪辑的视频中时序定位和分类细粒度子任务片段,对人机协作至关重要。不同于通用活动识别,协作操作需要直接可被机器人执行的子任务标签。我们提出RoboSubtaskNet,一种多阶段人机子任务分割框架,将注意力增强的I3D特征(RGB+光流)与采用斐波那契膨胀方案的改进型MS-TCN相结合,以捕获如到达-抓取-放置等短时序过渡。网络采用由交叉熵和时序正则化项(截断MSE和转换感知项)组成的复合目标进行训练,以减少过分割并鼓励有效的子任务进程。为弥合视觉基准与控制之间的差距,我们引入RoboSubtask数据集,包含医疗和工业演示视频,按子任务级别标注并设计为可确定性映射到操作臂基本范畴。经验上,RoboSubtaskNet在GTEA和我们的RoboSubtask基准上均优于MS-TCN和MS-TCN++(以边界敏感和序列指标衡量),在Breakfast长时序基准上表现仍具竞争力。具体结果显示:在GTEA上F1@50=79.5%,Edit=88.6%,Acc=78.9%;在Breakfast上F1@50=30.4%,Edit=52.0%,Acc=53.5%;在RoboSubtask上F1@50=94.2%,Edit=95.6%,Acc=92.2%。我们进一步在7自由度Kinova Gen3操作臂上验证了完整的感知到执行管线,实现了物理试验中可靠的端到端行为(整体任务成功率约91.25%)。这些结果表明,从子任务级别的视频理解到真实环境中的机器人操作具有实际可行的路径。

关键词

引用

@article{arxiv.2602.10015,
  title  = {RoboSubtaskNet: Temporal Sub-task Segmentation for Human-to-Robot Skill Transfer in Real-World Environments},
  author = {Dharmendra Sharma and Archit Sharma and John Rebeiro and Vaibhav Kesharwani and Peeyush Thakur and Narendra Kumar Dhar and Laxmidhar Behera},
  journal= {arXiv preprint arXiv:2602.10015},
  year   = {2026}
}