CaMEL:用于图像字幕的平均教师学习
计算机视觉与模式识别
2022-02-23 v1 人工智能
计算与语言
多媒体
摘要
用自然语言描述图像是自动建模视觉与文本模态之间联系的基础步骤。本文提出 CaMEL,一种基于 Transformer 的新型图像字幕架构。我们提出的方法利用两个相互连接的语言模型在训练阶段相互学习。这两个语言模型之间的相互作用遵循带有知识蒸馏的平均教师学习范式。我们在实验上于 COCO 数据集并结合不同的视觉特征提取器评估了所提方案的有效性。与现有方案相比,我们证明我们的模型以显著减少的参数数量提供了最先进的字幕质量。根据 CIDEr 指标,我们在不使用外部数据训练的情况下在 COCO 上取得了新的最先进水平。源代码与训练好的模型公开于:https://github.com/aimagelab/camel。
引用
@article{arxiv.2202.10492,
title = {CaMEL: Mean Teacher Learning for Image Captioning},
author = {Manuele Barraco and Matteo Stefanini and Marcella Cornia and Silvia Cascianelli and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:2202.10492},
year = {2022}
}