中文

SVGraph:从教学视频中学习语义图

计算机视觉与模式识别 2022-07-19 v1

摘要

本工作中,我们致力于为噪声教学视频生成图形化表示以用于视频理解。我们提出一种自监督、可解释的方法,无需任何图形化表示的标注,而此类标注的收集昂贵且耗时。我们尝试通过提出语义视频图(SVGraph)来克服“黑箱”学习局限,这是一种利用解说词实现所学图语义可解释性的多模态方法。SVGraph 1)借助跨模态注意力,依赖多种模态间的一致性学习统一的图结构;2)借助语义分配(Semantic-Assignment)赋予语义解释,其从视频解说中捕获语义。我们在多个数据集上开展实验,并展示了 SVGraph 在语义图学习中的可解释性。

关键词

引用

@article{arxiv.2207.08001,
  title  = {SVGraph: Learning Semantic Graphs from Instructional Videos},
  author = {Madeline C. Schiappa and Yogesh S. Rawat},
  journal= {arXiv preprint arXiv:2207.08001},
  year   = {2022}
}

备注

20 pages, 27 figures