中文

基于双不确定性引导的多模态推理策略学习

人工智能 2026-01-16 v2 计算与语言 机器学习

摘要

基于可验证奖励的强化学习(RLVR)已在多模态大语言模型中推进了推理能力。然而,现有方法通常将视觉输入视为确定性,忽视了视觉模态所固有的感知歧义。因此,这些方法无法区分模型的不确定性来源于复杂推理还是模糊感知,无法针对性地分配探索或学习信号。为此,我们提出DUPL(Dual-Uncertainty Guided Policy Learning),一种用于多模态RLVR的双不确定性引导策略学习方法,通过对称KL散度量化感知不确定性,通过策略熵量化输出不确定性,以指导策略更新。在建立不确定性驱动的反馈回路并采用动态分支优先级机制后,DUPL对策略优势进行校准,聚焦于具有高感知或决策模糊性的状态,从而实现对非被动数据增强之外的有效目标性探索。该方法基于GRPO实现,评估于六个多模态数学和通用领域推理基准测试中,对Qwen2.5-VL 3B和7B模型均取得显著提升,在视觉数学任务中实现最高达11.2%的准确率提升,在通用领域推理任务中实现最高达7.1%的准确率提升,并始终优于GRPO。这些结果表明,双不确定性引导的策略学习是一种有效且通用的多模态RLVR方法。

关键词

引用

@article{arxiv.2510.01444,
  title  = {Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning},
  author = {Rui Liu and Dian Yu and Tong Zheng and Runpeng Dai and Zongxia Li and Wenhao Yu and Zhenwen Liang and Linfeng Song and Haitao Mi and Pratap Tokekar and Dong Yu},
  journal= {arXiv preprint arXiv:2510.01444},
  year   = {2026}
}