中文

强化课程预对齐:面向领域自适应视觉语言模型的训练方法

计算与语言 2026-02-12 v1

摘要

视觉语言模型(VLMs)在通用任务上表现出惊人的能力,但在医学影像或几何问题解决等专门领域时常常表现不足。监督微调(SFT)可以增强特定领域的性能,但通常会导致灾难性遗忘,限制了其泛化能力。因此,核心挑战在于如何在保持通用能力的前提下,将 VLMs 适应新领域。对于大语言模型(LLMs)而言,持续预训练在扩充知识方面效果良好,但由于计算成本高昂且大多数开源模型缺乏预训练数据,对于 VLMs 而言几乎不可行。这使得高效的后训练适应方法成为必需。基于强化学习的方法,如基于组相对策略优化(GRPO),在保持通用能力方面显示出前景,但在初始模型缺乏足够领域知识的域适应场景中常常失败,导致优化崩溃。为弥合这一差距,我们提出一种强化课程预对齐(RCPA)方法,引入一种受课程驱动的渐进调制机制。在早期阶段,RCPA 施加部分输出约束,以安全地将模型暴露于新领域概念。随着模型对该领域熟悉度的增加,训练逐渐过渡到完全生成优化,细化响应并与领域特定偏好相一致。这种分阶段适应在领域知识获取与保持通用多模态能力之间实现了平衡。广泛的实验在专门领域和通用基准测试上均验证了 RCPA 的有效性,确立了构建高性能且领域自适应 VLMs 的实用路径。

关键词

引用

@article{arxiv.2602.10740,
  title  = {Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs},
  author = {Yuming Yan and Shuo Yang and Kai Tang and Sihong Chen and Yang Zhang and Ke Xu and Dan Hu and Qun Yu and Pengfei Hu and Edith C. H. Ngai},
  journal= {arXiv preprint arXiv:2602.10740},
  year   = {2026}
}