探索视觉语言任务中的课程学习:小规模多模态训练研究
机器学习
2024-10-22 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
在专业领域,训练大型机器学习模型时,往往缺乏充足的数据。在数据和计算资源有限的场景下, various methods exist aiming to ,例如从预训练模型微调、调节数据呈现给模型的难度级别(课程学习),以及考虑模型类型/规模的作用。高效学习方法也从学习中获得灵感,考虑到机器学习系统可获得的词数大约与13岁孩子经历的词数相同(1亿词)。我们在多模态轨道的婴儿语言挑战中,在数据有限的条件下研究了3个主要变量的作用。我们对比:(i)课程学习、(ii)预训练(使用文本-only数据)、(iii)模型类型。我们调节这些变量,在两种类型任务上进行评估:(a)多模态(文本+图像),和(b)单模态(文本-only)任务。我们发现,课程学习在非课程学习模型的多模态评估中都有益处,特别是当结合文本-only预训练时。在文本-only任务上,课程学习似乎对参数计数较小的模型有帮助。我们基于架构差异和训练设计,推测可能观察到此类结果的原因。
引用
@article{arxiv.2410.15509,
title = {Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training},
author = {Rohan Saha and Abrar Fahim and Alona Fyshe and Alex Murphy},
journal= {arXiv preprint arXiv:2410.15509},
year = {2024}
}
备注
CoNLL BabyLM Challenge 2024 camera ready