中文

多模态大模型是有效的动作预测器

计算机视觉与模式识别 2025-01-03 v1

摘要

长期动作预测任务需要能够有效建模长时间段内的时序动态,同时深入理解动作内在语义的解决方案。传统方法主要依赖循环单元或变换器层来捕获长期依赖,往往难以应对这些挑战。大型语言模型(LLM)凭借其强大的序列建模能力和广泛的常识知识,为长期动作预测提供了新的机遇。在本工作中,我们引入 ActionLLM 框架,这是一种新方法,将视频序列视为连续的标记,利用 LLM 进行动作预测。我们的基线模型通过设置未来标记、 incorporating action tuning 模块,并将文本解码器层简化为线性层,实现了无需复杂指令或冗余描述即可进行动作预测。为进一步发挥 LLM 的常识推理能力,我们预测观察帧的动作类别,并使用顺序文本线索指导语义理解。此外,我们引入了跨模态交互模块,旨在探索每个模态内的具体性,并捕捉视觉和文本模态之间的相互作用,从而增强多模态调优。在基准数据集上的大量实验表明,所提出的 ActionLLM 框架具有优势,鼓励在动作预测领域探索 LLM 的前景。代码可在 https://github.com/2tianyao1/ActionLLM.git 获取。

关键词

引用

@article{arxiv.2501.00795,
  title  = {Multimodal Large Models Are Effective Action Anticipators},
  author = {Binglu Wang and Yao Tian and Shunzhou Wang and Le Yang},
  journal= {arXiv preprint arXiv:2501.00795},
  year   = {2025}
}