中文

GLM-5V-Turbo:面向多模态智能体的原生基础模型

计算机视觉与模式识别 2026-05-13 v3

摘要

我们提出了GLM-5V-Turbo,旨�构建面向多模态智能体的原生基础模型。随着基础模型在真实环境中的部署,智能体能力不仅取决于语言推理,还取决于其感知、解释和行动对异构情境(如图像、视频、网页、文档、GUI等)的能力。GLM-5V-Turbo围绕这一目标构建:多模态感知被集成为推理、规划、工具使用和执行的核心组件,而非语言模型的辅助接口。本报告总结了GLM-5V-Turbo背后主要改进,包括模型设计、多模态训练、强化学习、工具链扩展以及与智能体框架的集成。这些发展在多模态编码、视觉工具使用和基于框架的智能体任务中表现出色,同时保持了具竞争力的纯文本编码能力。更重要的是,我们的开发过程为构建多模态智能体提供了实用见解,突出了多模态感知、层次化优化和可靠端到端验证的核心作用。

关键词

引用

@article{arxiv.2604.26752,
  title  = {GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents},
  author = {V Team and Wenyi Hong and Xiaotao Gu and Ziyang Pan and Zhen Yang and Yuting Wang and Yue Wang and Yuanchang Yue and Yu Wang and Yanling Wang and Yan Wang and Xijun Liu and Wenmeng Yu and Weihan Wang and Wei Li and Shuaiqi Duan and Sheng Yang and Ruiliang Lv and Mingdao Liu and Lihang Pan and Ke Ning and Junhui Ji and Jinjiang Wang and Jing Chen and Jiazheng Xu and Jiale Zhu and Jiale Cheng and Ji Qi and Guobing Gan and Guo Wang and Cong Yao and Zijun Dou and Zihao Zhou and Zihan Wang and Zhiqi Ge and Zhijie Li and Zhenyu Hou and Zhao Xue and Zehui Wang and Zehan Qi and Zehai He and Yutao Zhang and Yusen Liu and Yukuo Cen and Yuchen Li and Yuan Wang and Yu Yang and Yongbin Liu and Yijian Lu and Yifan Xu and Yanzi Wang and Yanxiao Zhao and Yanfeng Wang and Yadong Xue and Yabo Xu and Xinyu Zhang and Xinyu Liu and Xiao Liu and Wenyi Zhao and Wenkai Li and Tianyu Tong and Tianshu Zhang and Shudan Zhang and Shengdong Yan and Qinkai Zheng and Mingde Xu and Licheng Bao and lat Long long and Jiaxing Xu and Jiaxin Fan and Jiawen Qian and Jiali Chen and Jiahui Lin and Jiadai Sun and Haozhi Zheng and Haoran Wang and Haochen Li and Hanyu Lai and Han Xu and Fan Yang and Dan Zhang and Da Yin and Chuangxin Zhao and Chengcheng Wu and Boyan Shi and Bowen Lv and Bowei Jia and Bo Li and Bin Chen and Baoxu Wang and Peng Zhang and Debing Liu and Bin Xu and Juanzi Li and Minlie Huang and Yuxiao Dong and Jie Tang},
  journal= {arXiv preprint arXiv:2604.26752},
  year   = {2026}
}