中文

通过改进图像-文本对齐实现图像描述的持续学习

计算机视觉与模式识别 2025-11-19 v2

摘要

在持续学习环境中生成准确且连贯的图像描述仍是一个主要挑战,主要由于灾难性遗忘以及难以在时间维度上将演化中的视觉概念与语言对齐。在本工作中,我们提出了一种用于持续图像描述的新型多损失框架,集成了通过基于提示的持续学习和对比对齐所提供的语义指导。基于预训练的 ViT-GPT-2 backbone,我们的方法将标准交叉熵损失与三个额外组件相结合:(1) 一种基于提示的余弦相似度损失,将图像嵌入与编码述对象、属性和动作的合成提示对齐;(2) 一种 CLIP 风格的损失,促进图像嵌入与目标描述嵌入之间的对齐;(3) 一种语言引导的对比损失,使用三元组损失增强任务之间类别级判别性。值得注意的是,我们的方法在推理阶段无需额外开销,且在生成描述时无需使用提示。我们发现,该方法有效缓解了灾难性遗忘,同时在语义描述对齐方面优于当前最先进的方法。代码可通过以下链接获取:https://github.com/Gepardius/Taetz_Bordelius_Continual_ImageCaptioning

关键词

引用

@article{arxiv.2510.06009,
  title  = {Continual Learning for Image Captioning through Improved Image-Text Alignment},
  author = {Bertram Taetz and Gal Bordelius},
  journal= {arXiv preprint arXiv:2510.06009},
  year   = {2025}
}

备注

11 pages, 3 figures