GLM-4.5V 与 GLM-4.1V-Thinking:面向可扩展强化学习的通用多模态推理
计算机视觉与模式识别
2026-01-05 v6 人工智能
机器学习
摘要
我们提出了 GLM-4.1V-Thinking、GLM-4.5V 和 GLM-4.6V,一个面向通用多模态理解与推理的视觉语言模型 (VLM) 系列。本报告中,我们分享了在开发推理中心训练框架方面的关键发现。我们首先通过大规模预训练开发了一个具有显著潜力的视觉基础模型,这或许设定了最终性能的上限。我们然后提出了基于强化学习的课程抽样 (RLCS) 方法,以释放模型的全部潜力,实现对包括 STEM 问题解决、视频理解、内容识别、编码、定位、GUI 代理人和长文档解释在内的广泛任务的全面能力提升。在42个公共基准的全面评估中,GLM-4.5V 在大多数开源规模相似的模型中实现了最先进性能,并在包括编码和 GUI 代理人等具有挑战性的任务上表现出与 Gemini-2.5-Flash 等封闭源模型相称甚至更好的结果。与此同时,较小的 GLM-4.1V-9B-Thinking 同样高度具竞争力——在29个基准上超越了规模更大的 Qwen2.5-VL-72B。我们开源了 GLM-4.1V-9B-Thinking 和 GLM-4.5V。我们进一步引入了 GLM-4.6V 系列,开源的多模态模型具备原生工具使用能力和 128K 上下文窗口。概览可在 https://z.ai/blog/glm-4.6v 查看。代码、模型及更多信息已发布于 https://github.com/zai-org/GLM-V。
引用
@article{arxiv.2507.01006,
title = {GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning},
author = {V Team and Wenyi Hong and Wenmeng Yu and Xiaotao Gu and Guo Wang and Guobing Gan and Haomiao Tang and Jiale Cheng and Ji Qi and Junhui Ji and Lihang Pan and Shuaiqi Duan and Weihan Wang and Yan Wang and Yean Cheng and Zehai He and Zhe Su and Zhen Yang and Ziyang Pan and Aohan Zeng and Baoxu Wang and Bin Chen and Boyan Shi and Changyu Pang and Chenhui Zhang and Da Yin and Fan Yang and Guoqing Chen and Haochen Li and Jiale Zhu and Jiali Chen and Jiaxing Xu and Jiazheng Xu and Jing Chen and Jinghao Lin and Jinhao Chen and Jinjiang Wang and Junjie Chen and Leqi Lei and Letian Gong and Leyi Pan and Mingdao Liu and Mingde Xu and Mingzhi Zhang and Qinkai Zheng and Ruiliang Lyu and Shangqin Tu and Sheng Yang and Shengbiao Meng and Shi Zhong and Shiyu Huang and Shuyuan Zhao and Siyan Xue and Tianshu Zhang and Tianwei Luo and Tianxiang Hao and Tianyu Tong and Wei Jia and Wenkai Li and Xiao Liu and Xiaohan Zhang and Xin Lyu and Xinyu Zhang and Xinyue Fan and Xuancheng Huang and Yadong Xue and Yanfeng Wang and Yanling Wang and Yanzi Wang and Yifan An and Yifan Du and Yiheng Huang and Yilin Niu and Yiming Shi and Yu Wang and Yuan Wang and Yuanchang Yue and Yuchen Li and Yusen Liu and Yutao Zhang and Yuting Wang and Yuxuan Zhang and Zhao Xue and Zhengxiao Du and Zhenyu Hou and Zihan Wang and Peng Zhang and Debing Liu and Bin Xu and Juanzi Li and Minlie Huang and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2507.01006},
year = {2026}
}