中文

M$^3$Net:用于少样本细粒度动作识别的多视角编码、匹配与融合

计算机视觉与模式识别 2023-08-08 v1 多媒体

摘要

由于细粒度视频理解所需人工标注数据的稀缺,少样本细粒度(FS-FG)动作识别受到显著关注,旨在仅用少量标注样本对新颖细粒度动作类别进行分类。尽管少样本粗粒度动作识别已取得进展,当前方法在处理细粒度动作类别时面临两个挑战:无法捕捉细微动作细节,以及从具有高通类内方差与类间相似性的有限数据中学习不足。为应对这些局限,我们提出M3^3Net,一种用于FS-FG动作识别的基于匹配的框架,其融合\textit{多视角编码}、\textit{多视角匹配}与\textit{多视角融合},以促进跨多视角的嵌入编码、相似度匹配与决策制定。\textit{多视角编码}从帧内、视频内与片段内视角捕捉丰富上下文细节,为细粒度数据生成定制的高阶嵌入。\textit{多视角匹配}整合多种匹配函数,利用实例特定、类别特定与任务特定视角,在有限样本内实现灵活关系建模以处理多尺度时空变化。\textit{多视角融合}包含上述视角的匹配预测融合与匹配损失融合,前者促进相互互补,后者通过多任务协同学习增强嵌入泛化性。在三个具挑战性基准上的可解释可视化与实验结果表明,M3^3Net在捕捉细粒度动作细节与取得FS-FG动作识别SOTA性能方面的优越性。

关键词

引用

@article{arxiv.2308.03063,
  title  = {M$^3$Net: Multi-view Encoding, Matching, and Fusion for Few-shot Fine-grained Action Recognition},
  author = {Hao Tang and Jun Liu and Shuanglin Yan and Rui Yan and Zechao Li and Jinhui Tang},
  journal= {arXiv preprint arXiv:2308.03063},
  year   = {2023}
}

备注

Accepted by ACM MM 2023