中文

组合性在基于物体任务的零样本多标签动作识别中的影响

计算机视觉与模式识别 2024-05-15 v1 机器人学

摘要

在视频中处理多标签动作识别对动态环境中的机器人应用构成了重大挑战,特别是当机器人需要在涉及物体的任务中与人类合作时。现有方法仍然难以识别未见过的动作或需要大量训练数据。为了克服这些问题,我们提出了 Dual-VCLIP,一种用于零样本多标签动作识别的统一方法。Dual-VCLIP 增强了 VCLIP(一种零样本动作识别方法),结合了用于多标签图像分类的 DualCoOp 方法。我们方法的优势在于,在训练时它只学习两个 prompt,因此比其他方法简单得多。我们在包含大多数基于物体动作的 Charades 数据集上验证了我们的方法,证明——尽管它很简单——我们的方法在整个数据集上的表现与现有方法相当,并且在测试未见动作时表现出良好的性能。我们的贡献强调了在机器人针对新合作任务的训练过程中动词-物体类别划分的影响,突出了对性能的影响并提供了减轻偏差的见解。

关键词

引用

@article{arxiv.2405.08695,
  title  = {The impact of Compositionality in Zero-shot Multi-label action recognition for Object-based tasks},
  author = {Carmela Calabrese and Stefano Berti and Giulia Pasquale and Lorenzo Natale},
  journal= {arXiv preprint arXiv:2405.08695},
  year   = {2024}
}