通过人类解说的弱监督学习第一人称视角手持物体分割
计算机视觉与模式识别
2025-12-03 v2 人工智能
摘要
从第一人称视角图像中对用户操作的物体进行像素级识别,能够实现跨越辅助技术、工业安全和活动监控的关键应用。然而,由于现有方法依赖昂贵的手动标签,标注数据集的稀缺性目前阻碍了该领域的进展。在本文中,我们提出利用解说——即对摄像机佩戴者所执行动作的自然语言描述,其中包含有关被操作物体的线索——来学习人机交互检测。我们引入了解说监督的手持物体分割(NS-iHOS),这是一项新颖的任务,模型需要在弱监督机制下通过学习自然语言解说来分割手持物体。在推理时则不再使用解说。我们通过提出基于人类解说的弱监督手持物体分割(WISH)来展示该任务的潜力,这是一个端到端模型,从解说中蒸馏知识以学习合理的手物关联,并在测试时不使用解说即可实现手持物体分割。我们将 WISH 与基于开放词汇物体检测器和视觉语言模型的不同基线进行了基准测试。在 EPIC-Kitchens 和 Ego4D 上的实验表明,WISH 超越了所有基线,在未使用细粒度像素级标注的情况下,恢复了全监督方法 50% 以上的性能。代码和数据可在 https://fpv-iplab.github.io/WISH 找到。
引用
@article{arxiv.2509.26004,
title = {Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations},
author = {Nicola Messina and Rosario Leonardi and Luca Ciampi and Fabio Carrara and Giovanni Maria Farinella and Fabrizio Falchi and Antonino Furnari},
journal= {arXiv preprint arXiv:2509.26004},
year = {2025}
}
备注
Under consideration at Pattern Recognition Letters