中文

视觉语言模型的终身学习:增强型EWC与跨模态知识保留

机器人学 2026-05-14 v1

摘要

大型语言-视觉模型 (LVLMs) 如 CLIP、Flamingo 和 BLIP 已通过实现文本和视觉模态的理解而革新了人工智能。这些模型在图像字幕生成、视觉问答和跨模态检索等任务中表现出色。然而,它们在顺序学习新任务时会遭遇灾难性遗忘,这在多模态环境中尤其具有挑战性,因为在保持跨模态对齐方面增加了学习过程的复杂性。本文提出了一个针对 LVLMs 的综合持续学习框架,将增强型弹性权重Consolidation (EWC) 与参数高效微调技术相结合。我们集成了多模态 Fisher 信息矩阵计算、跨模态一致性保持以及考虑视觉和文本编码器之间依赖性的自适应正则化。该框架通过广泛的评估测试将遗忘率降低了 78%,相对于朴素的顺序训练方法。该框架在顺序学习期间仅增加 15% 的计算成本,即可在保持模态间对齐方面的成果。本工作推动了多模态 AI 系统终身学习的前沿进展,具有直接应用于自主驾驶、智能机器人助手以及必须在动态现实环境中持续学习的自适应机器人系统的潜力。

关键词

引用

@article{arxiv.2605.12789,
  title  = {Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention},
  author = {Hamza Ahmed Durrani and Rafay Suleman Durrani},
  journal= {arXiv preprint arXiv:2605.12789},
  year   = {2026}
}

备注

8 pages, 5 figures, 1 table. Applications in autonomous driving, intelligent robotic assistants, and adaptive robotics systems