向儿童学习:通过课程改进图像- caption 预训练
计算机视觉与模式识别
2023-05-31 v2 计算与语言
摘要
图像- caption 预训练已成功用于零样本图像分类和物体检测等下游视觉任务。然而,图像- caption 预训练仍是一个难题——它要求将 caption 中的多个概念(名词)与图像中的若干物体对齐。为解决这个问题,我们追本溯源——最佳学习者,儿童。我们从研究儿童语言学习的认知科学中汲取灵感,提出一种课程学习框架。学习从包含每个 caption 一个概念的易对齐图像- caption 对开始。随着每个新阶段逐步增加难度,每个 caption 增加一个概念。相应地,每个学习阶段获得的知识被用于后续阶段,以将学习问题有效约束为在每个阶段对齐一个新概念-物体对。我们表明该学习策略在多种设定下优于原始图像- caption 训练——从头预训练、使用预训练图像或/和预训练文本编码器、低数据量情况等。
引用
@article{arxiv.2305.17540,
title = {Learning from Children: Improving Image-Caption Pretraining via Curriculum},
author = {Hammad A. Ayyubi and Rahul Lokesh and Alireza Zareian and Bo Wu and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2305.17540},
year = {2023}
}
备注
ACL Findings 2023