中文

Omni-AutoThink:基于强化学习的自适应多模态推理

人工智能 2025-12-05 v2 声音

摘要

近期Omni模型的进展已实现统一的多模态感知与生成。然而,大多数现有系统仍表现出僵化的推理行为,要么对简单问题过度思考,要么在必要时未能进行推理。为解决这一局限,我们提出Omni-AutoThink,一种 Novel 的自适应推理框架,可根据任务难度动态调整模型的推理深度。我们的框架包含两个阶段:(1)自适应监督微调(Adaptive SFT)阶段,利用大规模推理增强数据为Omni模型提供基本推理能力;(2)自适应强化学习(Adaptive GRPO)阶段,基于任务复杂度和奖励反馈优化推理行为。我们进一步构建了一个涵盖文本单模态、文本-音频、文本-图像和文本-音频-图像多模态的全面自适应推理基准,提供训练和评估数据划分,用于多模态推理评估。实验结果表明,我们提出的框架显著优于先前基线,提高了自适应推理性能。所有基准数据和代码将公开发布。

关键词

引用

@article{arxiv.2512.03783,
  title  = {Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning},
  author = {Dongchao Yang and Songxiang Liu and Disong Wang and Yuanyuan Wang and Guanglu Wan and Helen Meng},
  journal= {arXiv preprint arXiv:2512.03783},
  year   = {2025}
}