面向图像描述的教师关键训练策略
计算机视觉与模式识别
2022-08-08 v1 多媒体
摘要
现有的图像描述模型通常通过交叉熵(XE)损失和强化学习(RL)进行训练,其将真实文本词作为硬目标并迫使描述模型从中学习。然而,广泛采用的训练策略存在 XE 训练中的不对齐以及 RL 训练中的不恰当奖励分配问题。为解决这些问题,我们引入一个教师模型,通过生成一些更易学习的词提议作为软目标,充当真实描述与描述模型之间的桥梁。该教师模型通过将真实图像属性融入基线描述模型而构建。为有效从教师模型学习,我们提出教师关键训练策略(TCTS)用于 XE 和 RL 训练,以促进描述模型更好的学习过程。在基准 MSCOCO 数据集上针对几种广泛采用的描述模型的实验评估表明,所提 TCTS 在两个训练阶段全面提升了大多数评估指标,尤其是 Bleu 和 Rouge-L 分数。TCTS 能够在 MSCOCO Karpathy 测试划分上取得迄今已发表的最佳单模型 Bleu-4 和 Rouge-L 性能,分别为 40.2% 和 59.4%。我们的代码与预训练模型将开源。
引用
@article{arxiv.2009.14405,
title = {Teacher-Critical Training Strategies for Image Captioning},
author = {Yiqing Huang and Jiansheng Chen},
journal= {arXiv preprint arXiv:2009.14405},
year = {2022}
}