多模态少样本时序动作检测
计算机视觉与模式识别
2023-03-28 v2 人工智能
计算与语言
机器学习
多媒体
摘要
少样本(FS)和零样本(ZS)学习是将时序动作检测(TAD)扩展到新类的两种不同方法。前者将预训练的视觉模型适配到每类仅少至单个视频所表示的新任务,而后者通过利用新类的语义描述无需训练样本。在本工作中,我们引入一个新的多模态少样本(MMFS)TAD 问题,它可被视为 FS-TAD 与 ZS-TAD 的结合,联合利用少样本支撑视频与新类名称。为应对该问题,我们进一步提出一种新颖的多模态提示元学习(MUPPET)方法。该方法通过高效桥接预训练视觉与语言模型,同时最大化复用已学习的能力得以实现。具体而言,我们使用元学习得到的带适配器的视觉语义分词器,将支撑视频映射到视觉-语言模型的文本 token 空间,从而构建多模态提示。为应对类内大变化,我们进一步设计了一种查询特征调节方案。在 ActivityNetv1.3 和 THUMOS14 上的大量实验表明,我们的 MUPPET 优于当前最优的替代方法,且常大幅领先。我们还展示了我们的 MUPPET 可轻松扩展以解决少样本目标检测问题,并在 MS-COCO 数据集上再次取得最优性能。代码将发布于 https://github.com/sauradip/MUPPET。
引用
@article{arxiv.2211.14905,
title = {Multi-Modal Few-Shot Temporal Action Detection},
author = {Sauradip Nag and Mengmeng Xu and Xiatian Zhu and Juan-Manuel Perez-Rua and Bernard Ghanem and Yi-Zhe Song and Tao Xiang},
journal= {arXiv preprint arXiv:2211.14905},
year = {2023}
}
备注
Technical Report