Qianfan-VL:领域增强通用视觉语言模型
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
我们提出 Qianfan-VL,这是一系列参数规模从 3B 至 70B 的多模态大语言模型,通过创新的领域增强技术实现了领先的性能。我们的方法采用多阶段渐进式训练和高精度数据合成管道,这些技术对于在保持强大通用性能的同时提升领域特定能力至关重要。Qianfan-VL 在 general benchmarks 上表现与领先的开源模型持平,在 CCBench、SEEDBench IMG、ScienceQA 和 MMStar 等基准测试上实现了最佳性能。领域增强策略在 OCR 和文档理解方面取得显著优势,分别在公开基准(OCRBench 873、DocVQA 94.75%)和内部评估中得到验证。值得注意的是,Qianfan-VL-8B 和 70B 变体集成了长链式思考能力,在数学推理(MathVista 78.6%)和逻辑推理任务中表现卓越。所有模型均在百度昆仑 P800 芯片上完成训练,验证了在 5000 块芯片上单任务训练规模为 90% 以上的效率,训练出具备 SOTA 水平的多模态模型。本工作建立了适用于多种企业部署场景的领域增强多模态模型开发有效方法。
引用
@article{arxiv.2509.18189,
title = {Qianfan-VL: Domain-Enhanced Universal Vision-Language Models},
author = {Daxiang Dong and Mingming Zheng and Dong Xu and Bairong Zhuang and Wenyu Zhang and Chunhua Luo and Haoran Wang and Zijian Zhao and Jie Li and Yuxuan Li and Hanjun Zhong and Mengyue Liu and Jieting Chen and Shupeng Li and Lun Tian and Yaping Feng and Xin Li and Donggang Jiang and Yong Chen and Yehua Xu and Duohao Qin and Chen Feng and Dan Wang and Henghua Zhang and Jingjing Ha and Jinhui He and Yanfeng Zhai and Chengxin Zheng and Jiayi Mao and Jiacheng Chen and Ruchang Yao and Ziye Yuan and Jianmin Wu and Guangjun Xie and Dou Shen},
journal= {arXiv preprint arXiv:2509.18189},
year = {2025}
}
备注
12 pages