中文

OneThinker: 图像与视频的通用推理模型

计算机视觉与模式识别 2026-04-29 v3

摘要

强化学习(RL)最近在激发多模态大语言模型(MLLM)中的视觉推理方面取得了显著成功。然而,现有方法通常针对不同任务训练独立模型,并将图像和视频推理视为互不相关的领域。这导致向多模态推理通用模型扩展的能力受限,限制了实际应用的灵活性,并阻碍了跨任务和模态的知识共享。为此,我们提出了 OneThinker,一个通用推理模型,统一了图像和视频理解,涵盖多样化的基础视觉任务,包括问答、描述生成、空间和时间定位、跟踪和分割。为实现这一目标,我们构建了覆盖所有这些任务的 OneThinker-600k 训练语料,并使用商业模型进行思维链标注,生成了 OneThinker-SFT-340k 用于 SFT 冷启动。此外,我们提出了 EMA-GRPO,通过跟踪各任务奖励标准差的移动平均值来处理多任务 RL 中的奖励异质性,从而实现均衡优化。在多样化视觉基准上的大量实验表明,OneThinker 在 31 个基准测试的 10 个基础视觉理解任务上取得了强劲性能。此外,它在某些任务之间展现出有效的知识迁移能力以及初步的零样本泛化能力,迈出了向统一多模态推理通用模型迈出的重要一步。所有代码、模型和数据均已发布。

关键词

引用

@article{arxiv.2512.03043,
  title  = {OneThinker: All-in-one Reasoning Model for Image and Video},
  author = {Kaituo Feng and Manyuan Zhang and Hongyu Li and Kaixuan Fan and Shuang Chen and Yilei Jiang and Dian Zheng and Peiwen Sun and Yiyuan Zhang and Haoze Sun and Yan Feng and Peng Pei and Xunliang Cai and Xiangyu Yue},
  journal= {arXiv preprint arXiv:2512.03043},
  year   = {2026}
}

备注

CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker