中文

SAMJAM:面向以自我为中心的厨房视频的零样本视频场景图生成

计算机视觉与模式识别 2025-04-11 v1

摘要

视频场景图生成(VidSGG)是理解动态厨房环境的重要课题。当前的 VidSGG 模型需要大量训练才能生成场景图。近期,视觉语言模型(VLM)和视觉基础模型(VFM)在各种任务中展现出了令人印象深刻的零样本能力。然而,像 Gemini 这样的 VLM 难以处理 VidSGG 的动态性,无法在帧之间保持稳定的物体身份。为了克服这一局限性,我们提出了 SAMJAM,这是一个零样本流水线,将 SAM2 的时间跟踪能力与 Gemini 的语义理解能力相结合。SAM2 还通过生成更准确的边界框改进了 Gemini 的物体定位。在我们的方法中,我们首先提示 Gemini 生成帧级场景图。然后,我们采用匹配算法将场景图中的每个物体与 SAM2 生成或 SAM2 传播的掩膜进行映射,从而在动态环境中生成时间一致的场景图。最后,我们在随后的每一帧中重复此过程。我们通过实验证明,SAMJAM 在 EPIC-KITCHENS 和 EPIC-KITCHENS-100 数据集上的平均召回率比 Gemini 高 8.33%。

关键词

引用

@article{arxiv.2504.07867,
  title  = {SAMJAM: Zero-Shot Video Scene Graph Generation for Egocentric Kitchen Videos},
  author = {Joshua Li and Fernando Jose Pena Cantu and Emily Yu and Alexander Wong and Yuchen Cui and Yuhao Chen},
  journal= {arXiv preprint arXiv:2504.07867},
  year   = {2025}
}