中文

M2-推理:通过统一的通用与空间推理增强多模态大语言模型

偏微分方程分析 2025-10-24 v2

摘要

最近的多模态大语言模型(MLLMs)通过可验证奖励强化学习(RLVR)取得了显著的推理能力提升。然而,这些模型仍在动态空间交互方面存在关键缺口,这是实际应用中必不可少的能力。为弥合这一差距,我们提出了 M2-推理-7B 模型,旨在在通用推理和空间推理方面卓越表现。我们的方法整合了两个关键创新:(1)一个新型数据管道,生成 294.2K 高质量数据样本(其中 168K 用于 cold-start 微调,126.2K 用于 RLVR),这些样本具有逻辑一致的推理轨迹并经过全面评估;(2)一种动态多任务训练策略,采用分步优化以缓解数据和任务之间的冲突,并为提供定制化激励信号。这种精心策划的数据和先进训练的组合,使 M2-推理-7B 在 8 个基准测试中达到新的最先进水平(SOTA),在通用和空间推理领域表现卓越。

关键词

引用

@article{arxiv.2507.08305,
  title  = {Global existence and boundedness in an attraction-repulsion chemotaxis system with nonlocal logistic source and sublinear productions},
  author = {Gnanasekaran Shanmugasundaram and Nithyadevi Nagarajan},
  journal= {arXiv preprint arXiv:2507.08305},
  year   = {2025}
}