中文

GRR-CoCa:在多模态模型架构中利用 LLM 机制

计算机视觉与模式识别 2025-07-25 v1 人工智能 计算与语言

摘要

当前最先进(SOTA)的图像和文本生成模型是多模态模型,与大语言模型(LLM)有许多相似之处。尽管取得了优异的性能,但领先的基础多模态模型架构常常不及当代 LLM 的架构精妙。我们提出了 GRR-CoCa,这是一个改进版的 SOTA 对比式字幕生成模型(CoCa),其在文本解码器和视觉 Transformer(ViT)编码器中引入了高斯误差门控线性单元、均方根归一化和旋转位置编码。每一种架构修改都已在 LLM 中证明有效,但尚未在 CoCa 中采用。我们使用标准的预训练和微调工作流程,对模型在对比和生成任务上进行基准测试。GRR-CoCa 在预训练数据集以及三个多样化的微调数据集上均显著优于基线 CoCa。预训练方面的改进在对比损失、困惑度和 CoCa 损失方面分别提升了 27.25%、3.71% 和 7.15%。平均微调改进在对比损失、困惑度和 CoCa 损失方面分别提升了 13.66%、5.18% 和 5.55%。我们表明,GRR-CoCa 的修改架构在视觉语言领域中提升了性能和泛化能力。

关键词

引用

@article{arxiv.2507.18009,
  title  = {GRR-CoCa: Leveraging LLM Mechanisms in Multimodal Model Architectures},
  author = {Jake R. Patock and Nicole Catherine Lewis and Kevin McCoy and Christina Gomez and Canling Chen and Lorenzo Luzi},
  journal= {arXiv preprint arXiv:2507.18009},
  year   = {2025}
}

备注

12 pages, 2 figures