中文

LoTLIP:提高长文本理解的语言-图像预训练

计算机视觉与模式识别 2024-11-14 v5

摘要

在实际应用中理解长文本的需求很大,但大多数语言-图像预训练(LIP)模型尚未达到。本文经验性地确认,关键原因在于训练图像通常与短标题配对,导致某些标记被显著标记所掩盖。为了解决这一问题,我们最初的尝试是用长标题重新标注数据,但直接学习可能导致对短文本理解(例如在图像分类任务中)出现性能下降。随后,我们通过引入角落标记来聚合多样化的文本信息,成功帮助模型恢复其对短文本理解的原始水平,同时大幅提升了长文本理解能力。我们进一步探讨了模型是否能从更长的标题中持续获益,发现性能与效率之间存在明显的权衡。最后,我们使用构建的大型数据集进行了有效验证,该数据集由 1000 万长标题导向的文本-图像对组成。我们的方法在长文本-图像检索任务中表现出优越性能。项目页面可在 https://wuw2019.github.io/lot-lip 查看。

关键词

引用

@article{arxiv.2410.05249,
  title  = {LoTLIP: Improving Language-Image Pre-training for Long Text Understanding},
  author = {Wei Wu and Kecheng Zheng and Shuailei Ma and Fan Lu and Yuxin Guo and Yifei Zhang and Wei Chen and Qingpei Guo and Yujun Shen and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2410.05249},
  year   = {2024}
}