MindOmni:通过 RGPO 释放视觉语言模型中的推理生成能力
人工智能
2025-06-12 v2
摘要
近期文本到图像系统在处理多模态输入和复杂推理任务方面存在局限。我们引入 MindOmni,一个统一的多模态大语言模型,通过强化学习融合推理生成能力以解决这些挑战。MindOmni 采用三阶段训练策略:i) 设计具备解码器专用的扩散模块的统一视觉语言模型,ii) 使用链式思维 (CoT) 指令数据进行监督式微调,iii) 我们提出的推理生成策略优化 (RGPO) 算法,利用多模态反馈有效指导策略更新。实验结果表明,MindOmni 在理解和生成基准测试中均优于现有模型,展现出强大的推理生成能力,尤其在数学推理指令方面表现尤为突出。所有代码将公开于 https://github.com/TencentARC/MindOmni
引用
@article{arxiv.2505.13031,
title = {MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO},
author = {Yicheng Xiao and Lin Song and Yukang Chen and Yingmin Luo and Yuxin Chen and Yukang Gan and Wei Huang and Xiu Li and Xiaojuan Qi and Ying Shan},
journal= {arXiv preprint arXiv:2505.13031},
year = {2025}
}
备注
Code: https://github.com/TencentARC/MindOmni