LowCLIP:为低资源语言中的多模态图像检索任务适配 CLIP 模型架构
计算机视觉与模式识别
2024-08-27 v1 计算与语言
摘要
本研究探索了为低资源语言( Specifically Azerbaijani 语种)中的图像检索开发多模态视觉语言模型。现有的视觉语言模型主要支持高资源语言,对其进行微调仍然计算密集。为解决低资源语言视觉语言检索中的挑战,我们集成了 CLIP 模型架构,并采用了多种技术在计算效率与性能之间进行平衡。这些技术包括通过机器翻译生成合成数据、图像增强,以及针对特定领域数据进一步训练基于 Transformer 的注意力机制。我们将 Multilingual BERT 作为文本编码器与图像编码器(如 ResNet50、EfficientNet0、Vision Transformer(ViT)和 Tiny Swin Transformer)集成。我们的研究发现,像 EfficientNet0 和 Tiny Swin Transformer 这样的模型在它们训练的数据集(如 COCO、Flickr30k 和 Flickr8k)上表现最佳。增强技术将 Flickr30k 上 EfficientNet0 的MAP提升至0.87(从0.84),将 MSCOCO 上 ResNet50 的MAP提升至0.80,为视觉语言检索带来了新的最佳状态。我们分享我们的配置和结果以支持进一步的研究。代码和预训练模型均可在 https://github.com/aliasgerovs/azclip 获取。
引用
@article{arxiv.2408.13909,
title = {LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task},
author = {Ali Asgarov and Samir Rustamov},
journal= {arXiv preprint arXiv:2408.13909},
year = {2024}
}