中文

Weather-R1:面向气象多模态推理的逻辑一致强化微调

计算机视觉与模式识别 2026-04-23 v1

摘要

尽管视觉语言模型(VLM)展现出日益增强的推理能力,但其在气象学中的应用受到领域鸿沟和推理忠实性鸿沟的制约。具体而言,主流的强化微调(RFT)可能引发自相矛盾推理(Self-Contra),即模型的推理过程与其最终答案相矛盾,这在气象学这类高风险领域是不可接受的。为应对这些挑战,我们构建了WeatherQA,一个新颖的气象学多模态推理基准。我们还提出了逻辑一致强化微调(LoCo-RFT),通过引入逻辑一致性奖励来解决自相矛盾推理问题。此外,我们推出了Weather-R1,据我们所知,这是气象学领域首个具备逻辑忠实性的推理视觉语言模型。实验表明,Weather-R1在WeatherQA上的性能比基线提升了9.8个百分点,优于监督微调和强化微调,甚至超越了原始的Qwen2.5-VL-32B。这些结果凸显了我们提出的LoCo-RFT的有效性以及Weather-R1的优越性。我们的基准和代码可在https://github.com/Marcowky/Weather-R1获取。

关键词

引用

@article{arxiv.2601.14044,
  title  = {Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology},
  author = {Kaiyu Wu and Pucheng Han and Hualong Zhang and Naigeng Wu and Keze Wang},
  journal= {arXiv preprint arXiv:2601.14044},
  year   = {2026}
}