基于自然语言监督的弱监督视频场景图生成
计算机视觉与模式识别
2025-02-24 v1
摘要
现有的视频场景图生成(VidSGg)研究均采用完全监督方式训练,需对视频中所有帧进行标注,从而 annotation 成本高于图像场景图生成(ImgSGg)。虽然可采用常用于ImgSGg的弱监督方法(WS-ImgSGg)以降低VidSGg的 annotation 成本,但视频标题中包含的时间性元素(如 before、while、then、after等表示时间关系的词)以及动作时长的可变性(不同于图像标题中人类动作的静态表现),使得这种直观的做法难以实现。为此,我们提出了基于自然语言的视频场景图生成(NL-VSGG)框架,仅利用可获取的视频标题训练VidSGg模型。NL-VSGG包含两个关键模块:时序感知标题分割(TCS)模块和动作时长可变性感知标题-帧对齐(ADV)模块。具体而言,TCS模块基于大型语言模型(LLM),按时间顺序将视频标题分割为多个句子;ADV模块则根据动作时长的可变性,将每个分割句子与合适的帧对齐。我们的方法在Action Genome数据集上与简单应用WS-ImgSGg流水线进行VidSGg相比取得了显著的性能提升。进一步利用视频标题作为弱监督,我们还展示了训练自NL-VSGG的VidSGg模型能够预测训练数据中不包含的更广泛范围的动作类别,这使得我们的框架在实际应用中更具实用性。
引用
@article{arxiv.2502.15370,
title = {Weakly Supervised Video Scene Graph Generation via Natural Language Supervision},
author = {Kibum Kim and Kanghoon Yoon and Yeonjun In and Jaehyeong Jeon and Jinyoung Moon and Donghyun Kim and Chanyoung Park},
journal= {arXiv preprint arXiv:2502.15370},
year = {2025}
}
备注
10 pages, ICLR 2025