中文

使用多模态大语言模型进行活动的时间 grounded 化

计算机视觉与模式识别 2024-07-09 v1 人工智能

摘要

活动的时间 grounded 化,即在更大事件上下文中识别特定动作时间区间的任务,是视频理解中的关键任务。最近的多模态大语言模型(LLM)为增强时间推理能力提供了新的机会。本文评估了将图像基和文本基大语言模型(LLM)在两阶段方法中结合用于时间活动局部化的有效性。我们展示了该方法优于现有视频基 LLM。此外,我们探讨了对较小的多模态 LLM 进行指令调优的影响,表明细化其处理动作查询的能力导致更具表达力和信息丰富的输出,从而增强其在识别活动特定时间区间方面的性能。我们的实验结果在 Charades-STA 数据集上凸显了该方法在推进时间活动局部化和视频理解领域的潜力。

关键词

引用

@article{arxiv.2407.06157,
  title  = {Temporal Grounding of Activities using Multimodal Large Language Models},
  author = {Young Chol Song},
  journal= {arXiv preprint arXiv:2407.06157},
  year   = {2024}
}