面向少样本动作识别的知识提示
计算机视觉与模式识别
2022-11-23 v1
摘要
视频中的少样本动作识别因其缺乏监督且难以泛化至未见动作而具挑战性。针对该任务,我们提出一种简洁而有效的方法,称为知识提示(knowledge prompting),其利用来自外部资源的动作常识知识来提示一个强大的预训练视觉-语言模型进行少样本分类。我们首先收集大规模的动作语言描述,定义为文本提议(text proposals),以构建动作知识库。文本提议的收集通过用手工句子模板填入外部动作相关语料,或从网络教学视频字幕中提取动作相关短语完成。随后我们将这些文本提议与视频帧一同输入预训练视觉-语言模型,生成各提议对每帧的匹配分数,这些分数可视为具有强泛化能力的动作语义。最后,我们设计了一个轻量级时序建模网络来捕捉动作语义的时序演化以进行分类。在六个基准数据集上的大量实验表明,我们的方法在普遍达到最先进(state-of-the-art)性能的同时,将训练开销降低至现有方法的 0.001。
引用
@article{arxiv.2211.12030,
title = {Knowledge Prompting for Few-shot Action Recognition},
author = {Yuheng Shi and Xinxiao Wu and Hanxi Lin},
journal= {arXiv preprint arXiv:2211.12030},
year = {2022}
}