中文

面向视频动作识别的语言驱动描述生成与常识推理

计算机视觉与模式识别 2025-06-23 v1

摘要

近期的视频动作识别方法通过适配大规模预训练语言-图像模型在视频领域取得优异性能。然而,语言模型蕴含丰富的常识先验——即人类用于构建对物体、人物-物体相互作用及活动理解的情景语境——这些先验尚未被充分利用。本文提出一种框架,融合语言驱动的常识先验,从单目视角中识别常被严重遮挡的杂乱视频动作序列。我们提出了三项技术:(1) 视频情景概述组件,生成候选物体、活动及物体与活动之间的相互作用;(2) 描述生成模块,基于情景上下文生成描述,推断后续活动,借助辅助提示与常识推理;(3) 多模态活动识别头部,整合视觉与文本线索以完成视频动作识别。我们在具有挑战性的Action Genome和Charades数据集上证明了该方法的有效性。

关键词

引用

@article{arxiv.2506.16701,
  title  = {Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition},
  author = {Xiaodan Hu and Chuhang Zou and Suchen Wang and Jaechul Kim and Narendra Ahuja},
  journal= {arXiv preprint arXiv:2506.16701},
  year   = {2025}
}