CLearViD:用于视频描述的课程学习
计算机视觉与模式识别
2023-11-09 v1 计算与语言
机器学习
摘要
视频描述旨在自动生成连贯的自然语言句子以叙述给定视频的内容。我们提出CLearViD,一种基于transformer的视频描述生成模型,利用课程学习完成该任务。具体而言,我们探究两种课程策略:(1)通过对视频数据逐渐施加高斯噪声,逐步将模型暴露于更困难的样本;(2)在训练过程中通过dropout逐步降低网络容量。这些方法使模型学习到更鲁棒且可泛化的特征。此外,CLearViD采用Mish激活函数,提供非线性和非单调性,并有助于缓解梯度消失问题。我们大量的实验与消融研究证明了所提模型的有效性。在ActivityNet Captions与YouCook2两个数据集上的结果表明,CLearViD在准确率和多样性指标上均显著优于现有SOTA模型。
引用
@article{arxiv.2311.04480,
title = {CLearViD: Curriculum Learning for Video Description},
author = {Cheng-Yu Chuang and Pooyan Fazli},
journal= {arXiv preprint arXiv:2311.04480},
year = {2023}
}
备注
15 pages, 4 figures