用于零样本动作识别的精细复述方法
计算机视觉与模式识别
2021-08-20 v2
摘要
动作类别数量的不断增长给视频理解带来了新挑战,使零样本动作识别(ZSAR)成为一个蓬勃发展的方向。ZSAR 任务旨在利用语义表示桥接已见与未见动作,从而在无训练样本的情况下识别目标(未见)动作。然而,由于动作的复杂性与多样性,语义表示动作类别并从已见数据迁移知识仍然困难。在本文中,我们受一种有效的人类记忆技术——精细复述(ER,Elaborative Rehearsal)启发,提出一种 ER 增强的 ZSAR 模型,该技术涉及详述新概念并将其与已知概念关联。具体而言,我们将每个动作类别扩展为一条精细描述(ED,Elaborative Description)句子,其比类名更具区分性且比人工定义属性成本更低。除直接将类别语义与视频对齐外,我们引入视频中的物体作为精细概念(EC,Elaborative Concepts)以改进视频语义及从已见动作到未见动作的泛化。我们的 ER 增强 ZSAR 模型在三个现有基准上取得了当前最优结果。此外,我们在 Kinetics 数据集上提出一种新的 ZSAR 评估协议,以克服当前基准的局限性,并展示了在该更真实设定下 ZSAR 性能首次可与少样本学习基线相媲美的案例。我们将在 https://github.com/DeLightCMU/ElaborativeRehearsal 发布代码与收集的 ED。
引用
@article{arxiv.2108.02833,
title = {Elaborative Rehearsal for Zero-shot Action Recognition},
author = {Shizhe Chen and Dong Huang},
journal= {arXiv preprint arXiv:2108.02833},
year = {2021}
}
备注
Accepted by ICCV 2021