VARCO-VISION-2.0 技术报告
计算机视觉与模式识别
2025-09-17 v2 计算与语言
摘要
我们介绍 VARCO-VISION-2.0,一种面向韩语和英语的开放权重双语视觉语言模型(VLM),其能力较前代模型 VARCO-VISION-14B 有所提升。该模型支持对文档、图表和表格等复杂输入的多图像理解,并通过同时预测文本内容及其空间位置提供布局感知 OCR。该模型采用四阶段课程训练并结合内存高效技术,实现了增强的多模态对齐,同时保留了核心语言能力并通过偏好优化提高了安全性。广泛的基准评估表明,该模型具有强大的空间定位能力,并在两种语言上均取得了具竞争力的结果,其中 14B 模型在 OpenCompass VLM 排行榜上同等规模模型中位列第 8。除 14B 规模的模型外,我们还发布了针对端侧部署优化的 1.7B 版本。我们相信这些模型推动了双语 VLM 的发展及其实际应用。VARCO-VISION-2.0 的两个变体可在 Hugging Face 上获取:全规模 14B 模型和轻量级 1.7B 模型。
引用
@article{arxiv.2509.10105,
title = {VARCO-VISION-2.0 Technical Report},
author = {Young-rok Cha and Jeongho Ju and SunYoung Park and Jong-Hyeon Lee and Younghyun Yu and Youngjune Kim},
journal= {arXiv preprint arXiv:2509.10105},
year = {2025}
}
备注
19 pages, 1 figure, 14 tables. Technical report for VARCO-VISION-2.0, a Korean-English bilingual VLM in 14B and 1.7B variants. Key features: multi-image understanding, OCR with text localization, improved Korean capabilities