中文

时间一致动态场景图:动作轨迹生成的一种端到端方法

计算机视觉与模式识别 2025-07-24 v2 机器学习

摘要

理解视频内容对于推进活动识别、自主系统和人机交互等实际应用至关重要。虽然场景图能够捕捉单帧图像中对象之间的空间关系,但将这些表示扩展到捕捉视频序列中的动态交互仍然是一个挑战。为此,我们提出了TCDSG,即时间一致动态场景图,这是一种端到端框架,能够跨时间检测、跟踪和关联主客体关系,生成动作轨迹,即实体及其关系的时间一致序列。我们的方法利用一种新颖的二部图匹配机制,并通过自适应解码器查询和反馈循环加以增强,确保了时间一致性和对长序列的稳健跟踪。该方法不仅在Action Genome、OpenPVSG和MEVA数据集上将时间召回率@k提升了超过60%,还开创性地为MEVA数据集添加了持久对象ID注释,以支持全面的轨迹生成。通过无缝集成空间和时间动态,我们的工作在视频分析领域树立了新的标杆,为监控、自主导航等高性能应用开辟了新途径。

关键词

引用

@article{arxiv.2412.02808,
  title  = {Temporally Consistent Dynamic Scene Graphs: An End-to-End Approach for Action Tracklet Generation},
  author = {Raphael Ruschel and Md Awsafur Rahman and Hardik Prajapati and Suya You and B. S. Manjuanth},
  journal= {arXiv preprint arXiv:2412.02808},
  year   = {2025}
}