Vision-OPD:通过在线自蒸馏学习使多模态大语言模型具备细粒度视觉感知能力
计算机视觉与模式识别
2026-05-28 v3 人工智能
计算与语言
机器学习
摘要
多模态大语言模型(MLLMs)在细粒度视觉理解方面仍存在困难,其答案往往取决于全图中的微小但决定性的证据。我们观察到一种从局部到全局的感知差距:同一 MLLM 在以证据为中心的裁剪图像为条件时,比在相应的全图上回答细粒度问题更准确,这表明许多失败源于难以聚焦相关证据,而非局部识别能力不足。受此观察启发,我们提出了 Vision-OPD(Vision On-Policy Distillation,视觉在线策略蒸馏),这是一个从局部到全局的自蒸馏框架,将模型自身的特权局部感知迁移至其全图策略。Vision-OPD 从同一 MLLM 实例化两个条件策略:以裁剪图像为条件的教师模型和以全图为条件的学生模型。学生模型生成在线策略轨迹,Vision-OPD 在这些轨迹上最小化教师与学生下一 token 分布之间的 token 级散度。这使得模型能够在无需外部教师模型、真值标签、奖励验证器或推理时工具使用的情况下,将视觉缩放的优势内化。在多个细粒度视觉理解基准上的实验表明,Vision-OPD 模型相较于大得多的开源、闭源以及“带图像思考”的智能体模型,取得了具有竞争力或更优的性能。
引用
@article{arxiv.2605.18740,
title = {Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation},
author = {Qianhao Yuan and Jie Lou and Xing Yu and Hongyu Lin and Le Sun and Xianpei Han and Yaojie Lu},
journal= {arXiv preprint arXiv:2605.18740},
year = {2026}
}
备注
Project page: https://github.com/VisionOPD/Vision-OPD