合成视觉基因2: 从视频中提取大规模时空场景图
计算机视觉与模式识别
2026-03-09 v3
摘要
我们介绍合成视觉基因2(SVG2), 一个大规模全景视频场景图数据集。SVG2包含超过63.6万个视频, 包含660万个对象, 5200万个属性, 和670万个关系, 相较于先前的时空场景图数据集规模和多样性提升了一个数量级。为创建SVG2, 我们设计了一套完全自动的管道, 组合多尺度全景分割, 在线-离线轨迹跟踪与自动新对象发现, 每条轨迹的语义解析, 以及基于GPT-5的时空关系推断。人类验证SVG2注释的准确性确认其可靠性(对象:93.8%, 属性:88.3%, 关系:85.4%)。基于这一资源, 我们训练了TRaSER视频场景图生成模型。TRaSER增强了VLM, 引入轨迹对齐token排列机制和新模块: 对象-轨迹重采样器和时序窗口重采样器, 将原始视频和全景轨迹转换为单个前向传递中的紧凑时空场景图。时序窗口重采样器将视觉token绑定到短轨迹片段以保留局部运动和时序语义, 而对象-轨迹重采样器则整合整个轨迹以保持对象的全局上下文。在PVSG、VIPSeg、VidOR和SVG2测试数据集上, TRaSER在关系检测方面比最强开源基线提高15-20%, 对象预测提高30-40%, 相较于GPT-5提高13%, 属性预测提高15%。当TRaSER生成的场景图发送给VLM进行视频问答时, 相较于仅使用视频或使用Qwen2.5-VL生成的场景图, 准确率提升1.5-4.6个百分点, 揭示了以显式时空场景图作为中间表示的实用性。
引用
@article{arxiv.2602.23543,
title = {Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos},
author = {Ziqi Gao and Jieyu Zhang and Wisdom Oluchi Ikezogwo and Jae Sung Park and Tario G. You and Daniel Ogbu and Chenhao Zheng and Weikai Huang and Yinuo Yang and Winson Han and Quan Kong and Rajat Saini and Ranjay Krishna},
journal= {arXiv preprint arXiv:2602.23543},
year = {2026}
}