中文

视觉-语言模型精调的学习动力学

机器学习 2025-10-15 v1 人工智能

摘要

基于偏好的数据驱动视觉-语言模型(VLM)精调脆弱: trivially 错误的负样本会注入无信息的梯度, destabilize 训练。我们将对齐问题重新定义为学习动力学感知优化,并提出 Cooling-Weighted DPO(CW-DPO),这是一种两种阶段的配方,显式建模并利用训练轨迹。阶段 1 执行监督式精调,采用温和负样本:低权重平滑监督在正则化基础策略并抑制过度自信,而无需显式惩罚。阶段 2 应用 DPO 目标,其中负样本项按模型在每个负样本上的平均 token log 概率计算的 cooling weight 进行比例缩放,抑制来自简单或分布外样本的无信息梯度,同时保留来自困难负样本的信号。在实践中,我们强调使用策略负样本,允许通过混合可控比例的数据负样本来维持对比的新鲜度。整个过程中,我们用 Δ ⁣logp\Delta\!\log p 对正负样本进行探针,以作为早期停止、课程设计和故障诊断的一级信号。 在多样化的 VLM 任务上,CW-DPO 实现了更稳定的优化、更好的校准和更高的成对获胜率,同时在更少的步骤中收敛。消融实验将 cooling-weight 机制确定为这些收益的主要驱动力,并显示混合策略负样本和数据负样本的组合具有互补优势。综上所述,我们的结果表明,在降温偏好之前平滑学习动力学是一种简单、通用的可靠 VLM 对齐原则。

关键词

引用

@article{arxiv.2510.11978,
  title  = {Learning Dynamics of VLM Finetuning},
  author = {Jusheng Zhang and Kaitong Cai and Jing Yang and Keze Wang},
  journal= {arXiv preprint arXiv:2510.11978},
  year   = {2025}
}