Bridge-Prompt:面向教学视频中有序动作理解
计算机视觉与模式识别
2022-03-29 v1 人工智能
机器学习
摘要
动作识别模型已展现出对短视频片段中人类动作进行分类的良好能力。在实际场景中,多个相关人类动作常按特定顺序发生,形成具有语义意义的人类活动。传统的动作识别方法聚焦于分析单个动作。然而,它们未能充分推理相邻动作间的上下文关系,而后者为理解长视频提供了潜在的时间逻辑。本文中,我们提出一种基于提示的框架 Bridge-Prompt(Br-Prompt),以建模相邻动作间的语义,从而同时利用教学视频中一系列有序动作的脱离上下文信息与上下文信息。更具体地,我们将个体动作标签重构为用于监督的集成文本提示,弥合了个体动作语义间的鸿沟。生成的文本提示与对应视频片段配对,并通过对比方法共同训练文本编码器与视频编码器。习得的视觉编码器对有序动作相关下游任务(如动作分割与人类活动识别)具有更强能力。我们在若干视频数据集上评测了方法性能:Georgia Tech Egocentric Activities (GTEA)、50Salads 与 Breakfast 数据集。Br-Prompt 在多个基准上达到 SOTA。代码见 https://github.com/ttlmh/Bridge-Prompt
引用
@article{arxiv.2203.14104,
title = {Bridge-Prompt: Towards Ordinal Action Understanding in Instructional Videos},
author = {Muheng Li and Lei Chen and Yueqi Duan and Zhilan Hu and Jianjiang Feng and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2203.14104},
year = {2022}
}
备注
Accepted to CVPR 2022