中文

面向图像描述的教师关键训练策略

计算机视觉与模式识别 2022-08-08 v1 多媒体

摘要

现有的图像描述模型通常通过交叉熵(XE)损失和强化学习(RL)进行训练,其将真实文本词作为硬目标并迫使描述模型从中学习。然而,广泛采用的训练策略存在 XE 训练中的不对齐以及 RL 训练中的不恰当奖励分配问题。为解决这些问题,我们引入一个教师模型,通过生成一些更易学习的词提议作为软目标,充当真实描述与描述模型之间的桥梁。该教师模型通过将真实图像属性融入基线描述模型而构建。为有效从教师模型学习,我们提出教师关键训练策略(TCTS)用于 XE 和 RL 训练,以促进描述模型更好的学习过程。在基准 MSCOCO 数据集上针对几种广泛采用的描述模型的实验评估表明,所提 TCTS 在两个训练阶段全面提升了大多数评估指标,尤其是 Bleu 和 Rouge-L 分数。TCTS 能够在 MSCOCO Karpathy 测试划分上取得迄今已发表的最佳单模型 Bleu-4 和 Rouge-L 性能,分别为 40.2% 和 59.4%。我们的代码与预训练模型将开源。

关键词

引用

@article{arxiv.2009.14405,
  title  = {Teacher-Critical Training Strategies for Image Captioning},
  author = {Yiqing Huang and Jiansheng Chen},
  journal= {arXiv preprint arXiv:2009.14405},
  year   = {2022}
}