中文

视觉语言模型能否用于视频动作识别?LLM 是视觉推理协调器

计算机视觉与模式识别 2024-07-23 v1

摘要

近期进步引入了多种视觉语言模型 (VLMs),在 various 领域展现出惊人的常识推理能力。尽管这些模型各自具备能力,但将这些互补 VLMs 协同作用的潜力仍未得到充分探索。Cola 框架通过自然语言通信显示了大语言模型 (LLM) 如何高效协调多个 VLMs 以利用其各自优势的可能性。我们在具有挑战性的 A-OKVQA 数据集上验证了这一主张,确认了这种协调的有效性。基于此,我们的研究探讨了相同方法能否应用于视频动作识别。具体而言,我们探讨了仅利用 VLMs 和 LLM 的组合知识库,是否能够仅凭少量关键帧和有限的时序信息即可有效推断视频中的动作。我们的实验表明,尽管时序信号较弱,LLM 在协调不同 VLMs 的情况下仍能成功识别各种情景中的模式并推断动作。然而,我们的发现表明,为增强这一方法作为可行替代方案的潜力,整合更强的时序信号并让模型接触略多的帧将大有裨益。

关键词

引用

@article{arxiv.2407.14834,
  title  = {Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators},
  author = {Harsh Lunia},
  journal= {arXiv preprint arXiv:2407.14834},
  year   = {2024}
}

备注

LLMs, VLMs, Action Recognition