基于多样物体-场景组合的零样本动作识别
计算机视觉与模式识别
2021-10-27 v1
摘要
本文研究了零样本动作识别问题,设定为没有任何包含已见动作的视频可用于训练。针对这一极具挑战性的场景,当前主流方法是通过使用预训练网络识别视频中的物体,进而实现物体与动作之间的语义匹配,从而从图像领域迁移知识。物体提供了视频内容的局部视角,而本工作中我们也试图纳入动作发生场景的全局视角。我们发现,仅凭场景本身也能识别未见动作,尽管其能力较物体更为有限,且将基于物体与基于场景的得分直接结合会降低动作识别性能。为充分利用物体与场景,我们提出将其构建为所有可能组合的笛卡尔积。我们阐述了如何确定视频中物体-场景组合的可能性,以及如何将物体-场景组合语义匹配到动作,并对每个动作最相关组合施加多样性约束。尽管简单,我们基于组合的方法优于基于物体的方法,甚至优于依赖含数百种已见动作的大规模视频数据集进行训练和知识迁移的当前最优零样本方法。
引用
@article{arxiv.2110.13479,
title = {Zero-Shot Action Recognition from Diverse Object-Scene Compositions},
author = {Carlo Bretti and Pascal Mettes},
journal= {arXiv preprint arXiv:2110.13479},
year = {2021}
}
备注
BMVC 2021