LASER:一种利用弱监督学习时空场景图的神经符号框架
计算机视觉与模式识别
2025-10-29 v7 机器学习
计算机科学中的逻辑
摘要
从视频中监督式学习时空场景图(STSG)的方法因其依赖带 STSG 标注的视频而受到极大阻碍,这类标注在大规模构建时极为耗费人力。是否可以使用现成的视频字幕作为弱监督来替代?为解答这一问题,我们提出 LASER,一种神经符号框架,仅使用视频字幕即可训练 STSG 生成器。LASER 首先利用大语言模型从视频字幕中提取带有丰富时空语义信息的逻辑规范,随后训练底层 STSG 生成器使预测的 STSG 与该规范对齐。该对齐算法通过借助可微分符号推理器并结合对比损失、时间损失与语义损失,克服了弱监督带来的挑战。整体方法高效训练底层感知模型以提取符合视频字幕的细粒度 STSG,从而实现了一种无需繁琐标注即可学习 STSG 的新范式。我们在三个视频数据集(OpenPVSG、20BN 和 MUGEN)上评估了该方法。我们的方法相较全监督基线有显著提升:在 OpenPVSG 上一元谓词预测准确率达 27.78%(+12.65%),二元 recall@5 为 0.42(+0.22);此外,在整体谓词预测准确率上,LASER 在 20BN 上超出基线 7%,在 MUGEN 上超出 5.2%。
引用
@article{arxiv.2304.07647,
title = {LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision},
author = {Jiani Huang and Ziyang Li and Mayur Naik and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2304.07647},
year = {2025}
}
备注
Accepted at International Conference on Learning Representations (ICLR) 2025