中文

C2C:组件到构件学习用于零样本构成动作识别

计算机视觉与模式识别 2024-07-22 v2

摘要

构成动作由动态(动词)和静态(对象)概念组成。人类可以轻松识别使用所学概念所构成的未见动作。对于机器人来说,需要模型能够识别由先前观察到的动词和对象组成的未见动作,这需要模型具备所谓的构成泛化能力。为促进此类研究,我们提出一种新的零样本构成动作识别(ZS-CAR)任务。为评估该任务,我们基于广泛使用的Something-Something V2数据集构建了一个新基准,Something-composition(Sth-com)。我们还提出了一种新的组件到构件(C2C)学习方法来解决新的ZS-CAR任务。C2C包括一个独立的组件学习模块和一个构件推理模块。最后,我们设计了一种增强的训练策略,以解决组件在看见和未见见构成动作之间的变异性问题,并处理在学习看见和未见见动作之间保持细微平衡的挑战。实验结果表明,该提议框架在现有构成泛化方法上显著超越,并取得了新的最佳性能。该新的Sth-com基准和代码均可访问于https://github.com/RongchangLi/ZSCAR_C2C。

关键词

引用

@article{arxiv.2407.06113,
  title  = {C2C: Component-to-Composition Learning for Zero-Shot Compositional Action Recognition},
  author = {Rongchang Li and Zhenhua Feng and Tianyang Xu and Linze Li and Xiao-Jun Wu and Muhammad Awais and Sara Atito and Josef Kittler},
  journal= {arXiv preprint arXiv:2407.06113},
  year   = {2024}
}

备注

Accepted by ECCV2024