中文

粗粒还是细粒?无标签识别动作终止状态

计算机视觉与模式识别 2024-05-14 v1

摘要

我们关注的是识别图像中动作终止状态的问题,这对于理解动作执行方式和方式至关重要。我们专注于预测切割的粗细,即决定物体是以“粗糙”还是“精细”方式切割。由于没有带有这些标记终止状态的数据集,故我们提出一种数据增强方法来合成训练数据。我们将该方法应用于从现有动作识别数据集中提取的切割动作。该方法具有通用性,即它预设了物体的位置但不预设其身份。仅需从不足一百张完整物体的图像开始,就可以生成数千张模拟不同粗细切割的图像。我们使用合成数据训练基于 UNet 的模型,并在真实图像上测试其识别粗糙/精细切割物体的能力。结果表明,该模型能够成功识别动作的终止状态,尽管训练与测试之间存在领域差距,并且该模型对未见物体具有良好的泛化能力。

关键词

引用

@article{arxiv.2405.07723,
  title  = {Coarse or Fine? Recognising Action End States without Labels},
  author = {Davide Moltisanti and Hakan Bilen and Laura Sevilla-Lara and Frank Keller},
  journal= {arXiv preprint arXiv:2405.07723},
  year   = {2024}
}

备注

The Eleventh Workshop on Fine-Grained Visual Categorization (CVPR 24)