利用动态损失网络提升视频描述生成
计算机视觉与模式识别
2022-02-03 v3 机器学习
摘要
视频描述是视觉与语言交叉领域的挑战性问题之一,在视频检索、视频监控、辅助视障人士、人机界面等诸多方面具有实际应用。近期基于深度学习的方法已显示出有希望的结果,但仍低于其他视觉任务(如图像分类、目标检测)。现有视频描述方法的一个显著缺点是它们针对交叉熵损失函数进行优化,而该函数与事实上的评估指标(BLEU、METEOR、CIDER、ROUGE)不相关。换句话说,交叉熵并非视频描述真实损失函数的恰当替代。为缓解此问题,REINFORCE、Actor-Critic和最小风险训练(MRT)等方法已被应用,但存在局限性且效果不佳。本文提出一种替代解决方案,通过引入动态损失网络(DLN)提供直接反映评估指标的额外反馈信号。我们的解决方案被证明比其他方案更高效,并且可以轻松适应类似任务。我们在Microsoft Research Video Description Corpus (MSVD)和MSR-Video to Text (MSRVTT)数据集上的结果优于先前的方法。
引用
@article{arxiv.2107.11707,
title = {Boosting Video Captioning with Dynamic Loss Network},
author = {Nasib Ullah and Partha Pratim Mohanta},
journal= {arXiv preprint arXiv:2107.11707},
year = {2022}
}
备注
8 pages, 4 figures, Preprint