HyRSM++:面向少样本动作识别的混合关系引导时序集合匹配
计算机视觉与模式识别
2023-01-10 v1
摘要
近期尝试主要聚焦于在情景元学习机制下为每支视频单独学习深度表示,随后进行时序对齐以匹配查询与支持视频。然而,它们仍存在两处缺陷:(i) 不考虑整个任务而学习个体特征可能导致表示能力有限;(ii) 现有对齐策略对噪声与错位实例敏感。为应对这两类局限,我们提出一种新颖的混合关系引导时序集合匹配(HyRSM++)方法用于少样本动作识别。HyRSM++ 的核心思想是整合任务内所有视频以学习判别性表示,并引入鲁棒匹配技术。具体而言,HyRSM++ 由两个关键组件构成:混合关系模块与时序集合匹配度量。给定特征提取器得到的基础表示,引入混合关系模块以充分挖掘情景任务内及跨视频的关联,从而学习任务特定嵌入。随后,在时序集合匹配度量中,我们从集合匹配视角执行查询与支持视频间距离度量,并设计 Bi-MHM 以提升对错位实例的鲁棒性。此外,我们显式利用视频中的时间相干性以正则化匹配过程。进一步地,我们将所提 HyRSM++ 扩展至更具挑战性的半监督少样本动作识别与无监督少样本动作识别任务。多个基准上的实验结果表明,我们的方法在各种少样本设定下均达到最先进性能。源代码见 https://github.com/alibaba-mmai-research/HyRSMPlusPlus。
引用
@article{arxiv.2301.03330,
title = {HyRSM++: Hybrid Relation Guided Temporal Set Matching for Few-shot Action Recognition},
author = {Xiang Wang and Shiwei Zhang and Zhiwu Qing and Zhengrong Zuo and Changxin Gao and Rong Jin and Nong Sang},
journal= {arXiv preprint arXiv:2301.03330},
year = {2023}
}
备注
An extended version of a paper arXiv:2204.13423 published in CVPR 2022. This work has been submitted to the Springer for possible publication