中文

基于动态帧选择的免训练动作识别与目标推断

计算机视觉与模式识别 2024-08-29 v2

摘要

我们提出了 VidTFS,一个免训练、开放词汇的视频目标与动作推断框架,该框架将冻结的视觉基础模型(VFM)和大语言模型(LLM)与一个新颖的动态帧选择模块相结合。我们的实验表明,所提出的帧选择模块显著提升了框架的性能。我们在四个广泛使用的视频数据集(包括 CrossTask、COIN、UCF101 和 ActivityNet)上验证了所提出的 VidTFS 的性能,这些数据集涵盖了开放词汇设置下的目标推断和动作识别任务,且无需任何训练或微调。结果表明,VidTFS 的性能优于那些直接堆叠 LLM 和 VFM 用于下游视频推断任务的预训练和指令微调多模态语言模型。我们的 VidTFS 凭借其适应性,展现了推广到新的免训练视频推断任务的未来潜力。

关键词

引用

@article{arxiv.2401.12471,
  title  = {Training-Free Action Recognition and Goal Inference with Dynamic Frame Selection},
  author = {Ee Yeo Keat and Zhang Hao and Alexander Matyasko and Basura Fernando},
  journal= {arXiv preprint arXiv:2401.12471},
  year   = {2024}
}