滚石不生苔藓:大型多模态模型中自适应策略优化的稳定自评估
机器学习
2025-08-14 v1 人工智能
摘要
自评估(self-evaluation)是指模型评估自身输出正确性的能力,这对于大型多模态模型(Large Multimodal Models, LMMs)在多轮对话中实现自我改进至关重要,但目前基础模型中几乎不存在。最近的研究采用强化学习(RL)来增强自评估;然而,其固定的奖励机制在优化多个训练目标时会出现奖励作弊,导致模型崩溃。本文提出AdaPO(Adaptive Policy Optimization),一种能够根据当前训练状态实时调整每个任务训练目标的在线强化学习框架。具体而言,为缓解奖励作弊,AdaPO引入自适应奖励模型(Adaptive Reward Model, ARM)和奖励感知动态KL正则化机制(Reward Aware Dynamic KL Regularization)。ARM从模型生成的多轮轨迹性能分布中评估任务的训练状态。奖励感知动态KL将固定惩罚替换为由不同多轮情境之间奖励差距调节的动态系数。值得注意的是,我们的方法无需人工干预,即可自动且平滑地根据子任务的训练进度调整学习焦点。对8个基准测试和各种模型进行大量实验表明,我们的方法显著提升了直接推理和自评估能力。我们将发布代码以助长社区发展。
引用
@article{arxiv.2508.09155,
title = {A Rolling Stone Gathers No Moss: Adaptive Policy Optimization for Stable Self-Evaluation in Large Multimodal Models},
author = {Wenkai Wang and Hongcan Guo and Zheqi Lv and Shengyu Zhang},
journal= {arXiv preprint arXiv:2508.09155},
year = {2025}
}
备注
17 pages, 9 figures