用于视频字幕的时空图与知识蒸馏
计算机视觉与模式识别
2020-04-01 v1
摘要
视频字幕是一项具有挑战性的任务,需要对视觉场景有深入理解。最先进的方法使用场景级或对象级信息生成字幕,但未显式建模对象交互。因此,它们常无法做出有视觉依据的预测,且对伪相关敏感。本文中,我们提出一种新颖的用于视频字幕的时空图模型,利用空间与时间上的对象交互。我们的模型建立可解释的链接,并能提供显式的视觉依据。为避免由可变对象数量导致的不稳定性能,我们进一步提出一种对象感知知识蒸馏机制,其中局部对象信息被用于正则化全局场景特征。我们通过在两个基准上的大量实验证明了方法的有效性,表明我们的方法以可解释的预测取得了有竞争力的性能。
引用
@article{arxiv.2003.13942,
title = {Spatio-Temporal Graph for Video Captioning with Knowledge Distillation},
author = {Boxiao Pan and Haoye Cai and De-An Huang and Kuan-Hui Lee and Adrien Gaidon and Ehsan Adeli and Juan Carlos Niebles},
journal= {arXiv preprint arXiv:2003.13942},
year = {2020}
}
备注
CVPR 2020