中文

遮蔽背景与物体能否减少零样本动作识别中的静态偏差?

计算机视觉与模式识别 2025-01-23 v1

摘要

本文针对零样本动作识别中的静态偏差问题展开研究。动作识别模型需要表示动作本身,而非外观。然而,一些全监督方法表明,模型往往依赖静态外观(如背景和物体),而非人类动作。这种问题被称为静态偏差,尚未针对零样本情境进行调查。虽然基于CLIP的零样本模型日益流行,但仍不清楚它们是否充分关注人类动作,因为CLIP主要捕获与语言相关的外观特征。本文调查了静态偏差在基于CLIP的零样本动作识别中的影响。我们的做法是在训练和验证期间对背景、物体和人物进行不同的遮蔽处理。实验中,遮蔽背景显示出模型依赖背景偏差——其在Kinetics400上的性能会下降。然而,对于背景偏差较弱的Mimetics,遮蔽背景即使在验证时遮蔽背景也能提升性能。此外,对SSv2进行不同颜色的背景和物体遮蔽可提升性能——SSv2具有较强的物体偏差。这些结果表明,在训练期间遮蔽背景或物体可防止模型过度依赖静态偏差,使其更关注人类动作。

关键词

引用

@article{arxiv.2501.12681,
  title  = {Can masking background and object reduce static bias for zero-shot action recognition?},
  author = {Takumi Fukuzawa and Kensho Hara and Hirokatsu Kataoka and Toru Tamaki},
  journal= {arXiv preprint arXiv:2501.12681},
  year   = {2025}
}

备注

In proc. of MMM2025