通过持续语言学习拥抱CLIP中的语言包容性与多样性
计算机视觉与模式识别
2024-01-31 v1 人工智能
信息检索
摘要
尽管视觉-语言预训练模型(VL-PTMs)近年来推动了多模态研究的发展,但它们在英语等少数语言上的精通限制了其在更广泛社区中的适用性。为此,通过联合学习设置开发多语言视觉-语言模型的兴趣日益增长,然而,由于高昂的成本和数据可用性,这可能不切实际。在这项工作中,我们提出通过持续语言学习(CLL)来扩展VL-PTMs的语言能力,其中模型需要增量式地更新其语言知识,而不遭受灾难性遗忘(CF)。我们通过引入一个名为CLL-CLIP的模型来开始我们的研究,该模型建立在CLIP之上,CLIP是一个主流的、已获得图像-英文文本对齐能力的VL-PTM。具体来说,CLL-CLIP包含一个可扩展的令牌嵌入层来处理语言差异。它仅训练令牌嵌入以提高记忆稳定性,并在跨模态和跨语言目标下进行优化,以学习图像与多语言文本之间的对齐。为了缓解由协变量偏移和词汇重叠引起的CF,我们进一步提出了一种新方法,该方法确保所有令牌嵌入在初始化期间具有相同的分布,并在训练期间对令牌嵌入学习进行正则化。我们基于MSCOCO和XM3600数据集构建了一个涵盖36种语言的CLL基准,然后评估了多语言图像-文本检索性能。大量实验验证了CLL-CLIP的有效性,并表明我们的方法可以提升CLL-CLIP的性能,例如,在XM3600上,文本到图像的平均Recall@1提高了6.7%,并持续改进了各种最先进的方法。我们的代码和数据可在\url{https://github.com/yangbang18/CLFM}获取。
引用
@article{arxiv.2401.17186,
title = {Embracing Language Inclusivity and Diversity in CLIP through Continual Language Learning},
author = {Bang Yang and Yong Dai and Xuxin Cheng and Yaowei Li and Asif Raza and Yuexian Zou},
journal= {arXiv preprint arXiv:2401.17186},
year = {2024}
}
备注
Accepted by AAAI'2024, 15 pages (with appendix), 7 figures, 10 tables