中文

CAPIVARA:提升低资源语言下多语言 CLIP 性能的成本高效方法

机器学习 2023-10-24 v2

摘要

本工作提出 CAPIVARA,一种旨在提升低资源语言中多语言 CLIP 模型性能的成本高效框架。尽管 CLIP 在零样本视觉-语言任务中表现出色,但模型训练的高资源消耗仍具挑战。许多数据集缺乏语言多样性,仅包含图像的英文描述。CAPIVARA 通过使用图像描述生成与机器翻译来扩充文本数据,生成低资源语言下的多个合成描述以解决此问题。我们通过 LiT、LoRA 与梯度检查点优化训练流程,以降低计算成本。经大量实验,CAPIVARA 成为涉及图像与葡萄牙语文本的零样本任务中的最优模型(state of the art)。我们展示了通过在单块 GPU 上利用 CAPIVARA 微调预训练多语言 CLIP 2 小时,在其他低资源语言中取得显著改进的潜力。我们的模型与代码发布于 https://github.com/hiaac-nlp/CAPIVARA。

关键词

引用

@article{arxiv.2310.13683,
  title  = {CAPIVARA: Cost-Efficient Approach for Improving Multilingual CLIP Performance on Low-Resource Languages},
  author = {Gabriel Oliveira dos Santos and Diego A. B. Moreira and Alef Iury Ferreira and Jhessica Silva and Luiz Pereira and Pedro Bueno and Thiago Sousa and Helena Maia and Nádia Da Silva and Esther Colombini and Helio Pedrini and Sandra Avila},
  journal= {arXiv preprint arXiv:2310.13683},
  year   = {2023}
}