面向时序全景场景图生成的运动感知对比学习
计算机视觉与模式识别
2026-04-28 v3
摘要
为了赋予人工智能对时序世界的全面理解,视频和 4D 全景场景图生成将视觉数据抽象为表示实体的节点和捕获时序关系的边。现有方法编码在时序维度上跟踪的实体掩码(掩码管),然后通过时序池化操作预测它们的关系,这并未充分利用指示实体关系的运动。为克服这一限制,我们引入了一种聚焦于运动模式的对比表示学习框架。首先,我们的框架鼓励模型学习相似主语-关系-宾语三元组对应掩码管的接近表示。其次,我们寻求将掩码管与其时序打乱版本分离开来。此外,我们还学习来自同一视频但属于不同三元组的掩码管之间的远距离表示。大量实验表明,我们的运动感知对比框架显著提升了视频和 4D 数据集上现有最先进方法的性能。代码可在 https://github.com/nguyentthong/motion-contrastive-sgg 获取。
引用
@article{arxiv.2412.07160,
title = {Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph Generation},
author = {Thong Thanh Nguyen and Xiaobao Wu and Yi Bin and Cong-Duy T Nguyen and See-Kiong Ng and Anh Tuan Luu},
journal= {arXiv preprint arXiv:2412.07160},
year = {2026}
}
备注
Accepted at AAAI 2025