中文

基于神经逻辑约束的零样本组合动作识别

计算机视觉与模式识别 2025-08-12 v2

摘要

零样本组合动作识别(ZS-CAR)旨在通过利用训练期间所学的动词与名词原语来识别视频中未出现的动词-名词组合。在ZS-CAR中实现组合学习仍面临两个关键挑战:1)缺乏组合结构约束,导致原语之间产生虚假关联;2)忽视语义层次约束,导致语义模糊,影响训练过程。本文认为,类人符号推理为解决这些挑战提供了原则方法,通过显式建模组合与层次结构抽象。为此,我们提出一种基于逻辑的ZS-CAR框架LogicCAR,集成双重符号约束:显式组合逻辑和层次原语逻辑。具体而言,前者建模组合内的限制,增强模型的组合推理能力;后者探讨不同原语间的语义依赖,赋予模型细到粗的推理能力。我们将这些约束以一阶逻辑形式化并嵌入神经网络架构,LogicCAR系统性地桥接了符号抽象与现有模型之间的鸿沟。在Sth-com数据集上进行的广泛实验表明,LogicCAR超越了现有基线方法,证明了逻辑驱动约束的有效性。

关键词

引用

@article{arxiv.2508.02320,
  title  = {Zero-shot Compositional Action Recognition with Neural Logic Constraints},
  author = {Gefan Ye and Lin Li and Kexin Li and Jun Xiao and Long Chen},
  journal= {arXiv preprint arXiv:2508.02320},
  year   = {2025}
}

备注

14 pages, 6 figures; Accepted by ACM MM2025