中文

面向动态场景图生成的商用大型多模态模型能做什么?

计算机视觉与模式识别 2025-03-21 v1

摘要

视频的动态场景图生成(DSGG)是计算机视觉中的一个具有挑战性的任务。虽然现有方法常关注复杂的架构设计,仅在评估时使用召回率,但我们深入审视了预测的场景图,发现现有DSGG方法存在三个关键问题:严重的精确率-召回率权衡、对三元组重要性缺乏意识,以及不恰当的评估协议。另一方面,近期进展的大型多模态模型(LMM)在视频理解方面显示出巨大的能力,但尚未在如DSGG这样的细粒度、逐帧理解任务上进行测试。在本工作中,我们对Video LMMs执行DSGG进行了首次系统性分析。我们表明,尽管不依赖复杂的架构设计,具有简单解码器结构的LMM可被转化为实现前述问题的SOTA场景图生成器,同时只需少量微调(5-10%训练数据)。

关键词

引用

@article{arxiv.2503.15846,
  title  = {What can Off-the-Shelves Large Multi-Modal Models do for Dynamic Scene Graph Generation?},
  author = {Xuanming Cui and Jaiminkumar Ashokbhai Bhoi and Chionh Wei Peng and Adriel Kuek and Ser Nam Lim},
  journal= {arXiv preprint arXiv:2503.15846},
  year   = {2025}
}