通过冗余削减加速视觉条件语言生成的训练
计算机视觉与模式识别
2024-02-22 v3
摘要
本文提出 ,一个精简框架,用于在计算需求较高的情况下,利用冻结的预训练大语言模型(LLMs)对视觉条件语言生成模型进行预训练。视觉-语言预训练(VLP)的传统方法通常包括两阶段优化过程:初始的资源密集型阶段致力于通用视觉-语言表征学习,侧重于提取并整合相关视觉特征;随后阶段强调视觉与语言模态间的端到端对齐。我们新颖的单阶段、单损失框架通过在训练中逐步合并相似视觉 token,规避了计算繁重的首阶段训练,同时避免了 BLIP-2 类模型单阶段训练引发的模型坍塌。该逐步合并过程在保留语义丰富性的同时有效压缩视觉信息,从而实现快速收敛且不损害性能。实验结果表明,我们的方法将视觉-语言模型的训练加速 5 倍,且对整体性能无明显影响。此外,我们展示仅使用 1/10 的数据,我们的模型便显著缩小了与当前视觉-语言模型的性能差距。最后,我们展示了通过新颖的软注意力时间 token 上下文建模模块,我们的图像-文本模型如何无缝适配视频条件语言生成任务。代码见 \url{https://github.com/yiren-jian/EVLGen}。
引用
@article{arxiv.2310.03291,
title = {Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction},
author = {Yiren Jian and Tingkai Liu and Yunzhe Tao and Chunhui Zhang and Soroush Vosoughi and Hongxia Yang},
journal= {arXiv preprint arXiv:2310.03291},
year = {2024}
}