SVGraph:从教学视频中学习语义图
计算机视觉与模式识别
2022-07-19 v1
摘要
本工作中,我们致力于为噪声教学视频生成图形化表示以用于视频理解。我们提出一种自监督、可解释的方法,无需任何图形化表示的标注,而此类标注的收集昂贵且耗时。我们尝试通过提出语义视频图(SVGraph)来克服“黑箱”学习局限,这是一种利用解说词实现所学图语义可解释性的多模态方法。SVGraph 1)借助跨模态注意力,依赖多种模态间的一致性学习统一的图结构;2)借助语义分配(Semantic-Assignment)赋予语义解释,其从视频解说中捕获语义。我们在多个数据集上开展实验,并展示了 SVGraph 在语义图学习中的可解释性。
引用
@article{arxiv.2207.08001,
title = {SVGraph: Learning Semantic Graphs from Instructional Videos},
author = {Madeline C. Schiappa and Yogesh S. Rawat},
journal= {arXiv preprint arXiv:2207.08001},
year = {2022}
}
备注
20 pages, 27 figures