中文

SCP:面向航拍视频动作识别的软条件提示学习

计算机视觉与模式识别 2024-08-29 v4

摘要

我们提出一种新的学习方法——软条件提示学习(SCP),其利用提示学习的优势进行航拍视频动作识别。我们的方法旨在通过帮助模型关注航拍/机器人视觉感知输入视频中与动作相关的描述或指令,来预测每个智能体的动作。我们的公式支持多种提示,包括可学习提示、辅助视觉信息与大型视觉模型,以提升识别性能。我们提出一种软条件提示方法,学习在不同视频输入下从提示专家池中动态生成提示。通过与任务共享同一目标,我们所提出的 SCP 可优化引导模型预测的提示,同时显式地学习输入不变(提示专家池)与输入相关(数据依赖)的提示知识。实践中,我们在由单智能体与多智能体动作场景构成的航拍视频数据集(Okutama、NECDrone)上观察到 3.17–10.2% 的准确率提升。我们进一步在地面相机视频上评估本方法以验证有效性与泛化性,并在 SSV2 数据集上取得 1.0–3.6% 的提升。我们还将该方法集成至 ROS2 中。

关键词

引用

@article{arxiv.2305.12437,
  title  = {SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition},
  author = {Xijun Wang and Ruiqi Xian and Tianrui Guan and Fuxiao Liu and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2305.12437},
  year   = {2024}
}

备注

IROS2024