利用弱标注的视频描述生成
计算机视觉与模式识别
2020-09-03 v1 人工智能
摘要
视频描述生成在近年来取得了令人瞩目的进展。现有方法性能提升的一个关键原因在于海量的视频-句子配对数据,但收集此类强标注(即高质量句子)耗时费力。事实上,现在存在数量惊人的仅含动作与物体等语义概念的弱标注视频。本文研究使用弱标注替代强标注来训练视频描述生成模型。为此,我们提出一种渐进式视觉推理方法,通过推断更多语义概念及其依赖关系,从弱标注逐步生成精细句子用于视频描述。为建模概念关系,我们利用大型句子语料库中的外部知识构建依赖树。通过遍历依赖树生成句子以训练描述模型。相应地,我们开发了一种迭代精炼算法,以交替训练方式通过构建依赖树精炼句子并利用精炼句子微调描述模型。实验结果表明,我们使用弱标注的方法与使用强标注的 SOTA 方法极具竞争力。
引用
@article{arxiv.2009.01067,
title = {Video Captioning Using Weak Annotation},
author = {Jingyi Hou and Yunde Jia and Xinxiao wu and Yayun Qi},
journal= {arXiv preprint arXiv:2009.01067},
year = {2020}
}