判别式训练:从带句子描述的视频中学习用句子描述视频
计算机视觉与模式识别
2013-06-25 v1 计算与语言
摘要
我们提出了一种方法,通过判别式训练 (DT) 将正向句子标签与负向句子标签进行对比,从而从复杂且真实的视频片段中学习词义,并利用训练好的词模型为新视频生成句子描述。这项新工作受到近期研究的启发,后者采用最大似然 (ML) 框架,仅使用正向句子标签来解决同一问题。与基于 ML 的方法类似,新方法能够以弱监督方式自动确定句子中的哪些词对应视频中的哪些概念(即 grounding 词义)。虽然 DT 和 ML 在训练数据充足时产生可比的结果,但在训练集较小时,DT 显著优于 ML,因为它可以利用负向训练标签更好地约束学习问题。
引用
@article{arxiv.1306.5263,
title = {Discriminative Training: Learning to Describe Video with Sentences, from Video Described with Sentences},
author = {Haonan Yu and Jeffrey Mark Siskind},
journal= {arXiv preprint arXiv:1306.5263},
year = {2013}
}