面向少样本动作识别的多模态原型增强网络
计算机视觉与模式识别
2024-05-22 v3 人工智能
摘要
当前少样本动作识别方法主要落入遵循 ProtoNet 的度量学习框架,其证明了原型的重要性。尽管它们取得了相对较好的性能,但多模态信息(例如标签文本)的作用被忽视了。在本文中,我们提出一种新颖的多模态原型增强网络(MORN),其利用标签文本的语义信息作为多模态信息来增强原型。引入 CLIP 视觉编码器和冻结的 CLIP 文本编码器以获得具有良好多模态初始化的特征。随后在视觉流中,视觉原型由视觉原型计算模块计算得到。在文本流中,采用语义增强(SE)模块和膨胀操作来获得文本原型。最终的多模态原型随后由多模态原型增强(MPE)模块计算。此外,我们定义了原型相似度差异(PRIDE)来评估原型的质量,用于验证我们在原型层面的改进以及 MORN 的有效性。我们在四个流行的少样本动作识别数据集 HMDB51、UCF101、Kinetics 和 SSv2 上进行了大量实验,MORN 取得了最先进的(SOTA)结果。当将 PRIDE 插入训练阶段时,性能可进一步提升。
引用
@article{arxiv.2212.04873,
title = {Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition},
author = {Xinzhe Ni and Yong Liu and Hao Wen and Yatai Ji and Jing Xiao and Yujiu Yang},
journal= {arXiv preprint arXiv:2212.04873},
year = {2024}
}
备注
Accepted by ICMR 2024 (oral)