中文

Dreaming Out Loud:一种利用发展合理性数据训练视觉语言模型的自合成方法

计算机视觉与模式识别 2024-11-05 v1 机器学习

摘要

尽管当今大型语言模型在生成类人文本方面展现出令人印象深刻的能力,但它们在训练过程中需要海量数据。我们在此从人类认知发展中汲取灵感,在有限数据条件下训练模型。具体而言,我们提出了一种自合成方法,迭代经历四个阶段:第一阶段建立基本语言能力,在一个小语料库上从头训练模型。第二阶段将语言与视觉环境关联,通过集成视觉编码器使模型能够从标注图像生成描述性标题。在"自合成"第三阶段,模型为无标注图像生成标题,然后利用合成文本与先前真实文本的混合进一步训练其语言组件。该阶段旨在扩展模型的语言库,类似于人类对新经历进行自我标注。最后,第四阶段通过训练模型完成特定任务(如视觉问答和推理)来发展高级认知技能。我们的方法为使用发展合理数量的数据训练多模态模型提供了一个概念验证。

关键词

引用

@article{arxiv.2411.00828,
  title  = {Dreaming Out Loud: A Self-Synthesis Approach For Training Vision-Language Models With Developmentally Plausible Data},
  author = {Badr AlKhamissi and Yingtian Tang and Abdülkadir Gökce and Johannes Mehrer and Martin Schrimpf},
  journal= {arXiv preprint arXiv:2411.00828},
  year   = {2024}
}

备注

Accepted to BabyLM Challenge at CoNLL 2024