基于多模态查询的演员无关多标签动作识别
计算机视觉与模式识别
2024-01-11 v3 人工智能
机器学习
图像与视频处理
摘要
现有的动作识别方法由于演员之间固有的拓扑和表观差异通常是演员特定的。这需要演员特定的姿态估计(例如人类与动物),导致繁琐的模型设计复杂度和高维护成本。此外,它们通常仅关注视觉模态的学习和单标签分类,而忽视其他可用信息源(例如类名文本)以及多个动作同时发生的情况。为克服这些局限,我们提出了一种称为“演员无关多模态多标签动作识别”的新方法,为包括人类和动物在内的各类演员提供统一解决方案。我们进一步在基于transformer的目标检测框架(例如DETR)中构建了新颖的多模态语义查询网络(MSQNet)模型,其特点是利用视觉和文本模态更好地表示动作类别。消除演员特定的模型设计是一大关键优势,因为它完全免除了对演员姿态估计的需求。在五个公开基准上的大量实验表明,我们的MSQNet在人类和动物的单标签及多标签动作识别任务上持续优于此前的演员特定替代方法,最高达50%。代码发布于https://github.com/mondalanindya/MSQNet。
引用
@article{arxiv.2307.10763,
title = {Actor-agnostic Multi-label Action Recognition with Multi-modal Query},
author = {Anindya Mondal and Sauradip Nag and Joaquin M Prada and Xiatian Zhu and Anjan Dutta},
journal= {arXiv preprint arXiv:2307.10763},
year = {2024}
}
备注
Published at the 2023 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), Paris, France