用于视频场景图生成的空间-时间知识嵌入Transformer
计算机视觉与模式识别
2023-12-18 v3
摘要
视频场景图生成(VidSGG)旨在识别给定视频中视觉场景里的物体并推断其关系。它不仅需要对散布于整个场景的每个物体有全面理解,还需深入探究其时间运动与交互。本质上,物体对及其关系在每幅图像内享有空间共现关联,在不同图像间享有时间一致性/转移关联,这些可作为先验知识促进VidSGG模型学习与推断。本文提出空间-时间知识嵌入Transformer(STKET),将先验空间-时间知识融入多头交叉注意力机制以学习更具代表性的关系表示。具体地,我们首先以统计方式学习空间共现与时间转移关联。然后,设计空间与时间知识嵌入层,引入多头交叉注意力机制充分挖掘视觉表示与知识间的交互,分别生成空间与时间嵌入表示。最后,我们对每个主-客体对聚合这些表示以预测最终语义标签及其关系。大量实验表明STKET大幅优于当前竞争算法,例如在多种设置下将mR@50较当前算法分别提升8.1%、4.7%与2.1%。
引用
@article{arxiv.2309.13237,
title = {Spatial-Temporal Knowledge-Embedded Transformer for Video Scene Graph Generation},
author = {Tao Pu and Tianshui Chen and Hefeng Wu and Yongyi Lu and Liang Lin},
journal= {arXiv preprint arXiv:2309.13237},
year = {2023}
}
备注
Accepted at IEEE T-IP, 2024