中文

rt-RISeg:面向主动实例级对象理解的实时无模型机器人交互式分割

机器人学 2025-07-16 v1 计算机视觉与模式识别

摘要

在新环境中执行灵巧机器人操作任务(如抓取)取决于能够熟练地将不可见对象从背景和其他对象中分割出来。先前的不可见对象实例分割(UOIS)方法在大规模数据集上训练,常导致对静态视觉特征的过拟合。这种依赖导致在面对分布外情景时泛化性能较差。为解决这一局限性,我们基于视觉本质上是交互式且随时间推移的原则重新构想 UOIS 任务。我们提出了一种新型实时交互式感知框架 rt-RISeg,通过机器人交互和分析设计的身体帧不变特征(BFIF)持续分割不可见对象。我们展示了,由于所选机器人交互产生的随机身体帧的相对旋转和线性速度,可用于在无需任何已学习分割模型的情况下识别对象。该完全自包含的分割管道在每一次机器人交互期间生成和更新对象分割掩码,而无需等待动作完成。我们通过在 UOIS 方法中实现平均对象分割准确率提高 27.5% 来展示所提出交互式感知方法的有效性。此外,尽管 rt-RISeg 是一个独立框架,我们还展示了该框架生成的自主分割掩码可用作视觉基础模型的提示,以实现显著性能提升。

关键词

引用

@article{arxiv.2507.10776,
  title  = {rt-RISeg: Real-Time Model-Free Robot Interactive Segmentation for Active Instance-Level Object Understanding},
  author = {Howard H. Qian and Yiting Chen and Gaotian Wang and Podshara Chanrungmaneekul and Kaiyu Hang},
  journal= {arXiv preprint arXiv:2507.10776},
  year   = {2025}
}

备注

8 pages, IROS 2025, Interactive Perception, Segmentation, Robotics, Computer Vision