中文

X-Reasoner:迈向跨模态与跨领域的可泛化推理

人工智能 2025-05-09 v1 计算与语言 机器学习

摘要

最近的专有模型(例如 o3)已开始展现出强大的多模态推理能力。然而,大多数现有的开源研究集中于训练纯文本推理模型,其评估主要限于数学和通用领域任务。因此,如何有效地将推理能力扩展到文本输入和通用领域之外,目前尚不清楚。本文探讨了一个基础研究问题:推理是否可跨模态和跨领域泛化?我们的发现支持一个肯定的答案:基于通用领域文本的后训练可以实现这种强大的可泛化推理。利用这一发现,我们引入了 X-Reasoner,这是一个仅在通用领域文本上进行后训练以实现可泛化推理的视觉-语言模型,采用两阶段方法:初始的监督微调阶段,使用提炼的长思维链,随后是带有可验证奖励的强化学习。实验表明,X-Reasoner 成功地将推理能力迁移到多模态和领域外设置,在各种通用和医学基准测试中,其性能优于使用领域内和多模态数据训练的现有最先进模型(图 1)。此外,我们发现 X-Reasoner 在专业领域的性能可以通过在特定领域的纯文本数据上继续训练得到进一步增强。基于此,我们引入了 X-Reasoner-Med,这是一个医学专业变体,在众多纯文本和多模态医学基准测试中达到了新的最先进水平。

关键词

引用

@article{arxiv.2505.03981,
  title  = {X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains},
  author = {Qianchu Liu and Sheng Zhang and Guanghui Qin and Timothy Ossowski and Yu Gu and Ying Jin and Sid Kiblawi and Sam Preston and Mu Wei and Paul Vozila and Tristan Naumann and Hoifung Poon},
  journal= {arXiv preprint arXiv:2505.03981},
  year   = {2025}
}