通过两步释义微调CLIP文本编码器
计算机视觉与模式识别
2024-02-26 v1 人工智能
机器学习
摘要
对比语言-图像预训练模型在各种视觉-语言任务中取得了显著成功,例如文本到图像检索,其中模型需要有效处理自然语言输入以产生准确的视觉输出。然而,当前模型在处理输入查询中的语言变体(如释义)方面仍存在局限性,这使得在实际应用中处理广泛的用户查询具有挑战性。在本研究中,我们引入了一种简单的微调方法来增强CLIP模型对释义的表示。我们的方法涉及一个两步释义生成过程,我们利用大型语言模型从网络规模的图像标题中自动创建两类释义。随后,我们在冻结图像编码器的同时,使用这些生成的释义微调CLIP文本编码器。我们得到的模型称为ParaCLIP,在各种任务上相比基线CLIP模型表现出显著改进,包括释义检索(排名相似度得分提高了最多2.0%和5.6%)、Visual Genome关系与属性,以及七个语义文本相似性任务。
引用
@article{arxiv.2402.15120,
title = {Fine-tuning CLIP Text Encoders with Two-step Paraphrasing},
author = {Hyunjae Kim and Seunghyun Yoon and Trung Bui and Handong Zhao and Quan Tran and Franck Dernoncourt and Jaewoo Kang},
journal= {arXiv preprint arXiv:2402.15120},
year = {2024}
}
备注
EACL 2024 (Findings of the ACL)