基于动态帧选择的免训练动作识别与目标推断
计算机视觉与模式识别
2024-08-29 v2
摘要
我们提出了 VidTFS,一个免训练、开放词汇的视频目标与动作推断框架,该框架将冻结的视觉基础模型(VFM)和大语言模型(LLM)与一个新颖的动态帧选择模块相结合。我们的实验表明,所提出的帧选择模块显著提升了框架的性能。我们在四个广泛使用的视频数据集(包括 CrossTask、COIN、UCF101 和 ActivityNet)上验证了所提出的 VidTFS 的性能,这些数据集涵盖了开放词汇设置下的目标推断和动作识别任务,且无需任何训练或微调。结果表明,VidTFS 的性能优于那些直接堆叠 LLM 和 VFM 用于下游视频推断任务的预训练和指令微调多模态语言模型。我们的 VidTFS 凭借其适应性,展现了推广到新的免训练视频推断任务的未来潜力。
引用
@article{arxiv.2401.12471,
title = {Training-Free Action Recognition and Goal Inference with Dynamic Frame Selection},
author = {Ee Yeo Keat and Zhang Hao and Alexander Matyasko and Basura Fernando},
journal= {arXiv preprint arXiv:2401.12471},
year = {2024}
}