基于跨模态相似度的课程学习用于图像描述
计算机视觉与模式识别
2022-12-15 v1 计算与语言
摘要
图像描述模型需要具备用词语描述各种图像内容的高级泛化能力。大多数现有方法在训练中将图像-描述对等对待,而不考虑其学习难度的差异。若干图像描述方法引入了课程学习,以递增的难度呈现训练数据。然而,它们的难度度量要么基于特定领域特征,要么基于先验模型训练。本文中,我们提出一种简单而高效的图像描述难度度量,使用预训练视觉-语言模型计算的跨模态相似度。在COCO和Flickr30k数据集上的实验表明,我们提出的方法取得了优于基线且具竞争力的收敛速度,无需启发式规则或产生额外训练成本。此外,模型在困难样本和未见过数据上的更高性能也证明了其泛化能力。
引用
@article{arxiv.2212.07075,
title = {Cross-Modal Similarity-Based Curriculum Learning for Image Captioning},
author = {Hongkuan Zhang and Saku Sugawara and Akiko Aizawa and Lei Zhou and Ryohei Sasano and Koichi Takeda},
journal= {arXiv preprint arXiv:2212.07075},
year = {2022}
}
备注
EMNLP 2022