中文

面向零样本动作识别与定位的通用原型迁移

计算机视觉与模式识别 2023-08-02 v2

摘要

本工作解决在无可用的训练样本时识别视频中动作类别的问题。当前最先进方法通过学习从视频到语义空间的通用映射实现此类零样本识别,这些映射或在大规模已见动作上训练,或在物体上训练。尽管有效,我们发现通用动作与物体映射在语义空间中偏向特定区域。这些偏置导致一个根本问题:许多未见动作类别在测试时根本无法被推断。例如在 UCF-101 上,最先进的通用动作模型有四分之一的未见动作无法触及。为此,本文引入面向零样本动作识别的通用原型迁移。核心思想是通过将未见动作的语义原型与所有测试视频的分布相匹配来重新定位它们。对于通用动作模型,我们提出通过从未见动作原型到所有投影测试视频集合的超球面最优传输来匹配分布。所得传输耦合进而决定每个未见动作的目标原型。我们并非直接将目标原型作为最终结果,而是沿原始与原型间测地线重新定位未见动作原型,作为一种语义正则化。对于通用物体模型,我们给出一种变体,其基于未见动作原型与物体原型间的最优传输定义目标原型。经验上,我们表明通用原型迁移减少了未见动作原型的偏置选择,并提升了通用动作与物体模型在零样本分类及时空定位上的表现。

关键词

引用

@article{arxiv.2203.03971,
  title  = {Universal Prototype Transport for Zero-Shot Action Recognition and Localization},
  author = {Pascal Mettes},
  journal= {arXiv preprint arXiv:2203.03971},
  year   = {2023}
}