中文

VARCO-VISION:扩展韩语视觉语言模型的前沿

计算机视觉与模式识别 2024-12-02 v1 计算与语言

摘要

本文我们介绍了一种开源的韩语-英语视觉语言模型 (VLM),VARCO-VISION。我们采用分步骤的训练策略,使模型能够在保持基础模型知识的同时学习语言和视觉信息。我们的模型在需要双语图像-文本理解和生成能力的各种场景下,显示出优异的性能,相对于类似规模的模型表现突出。VARCO-VISION 还能够进行 grounding、指代和 OCR,拓宽了其在实际场景中的使用和潜在应用。除了模型本身,我们发布了五个韩语评估数据集,包括四个封闭集合基准和一个开放集合基准。我们预计这一里程碑将为寻求训练 VLM 的 AI 研究者提供更多机会。VARCO-VISION 可在 https://huggingface.co/NCSOFT/VARCO-VISION-14B 上获得。

关键词

引用

@article{arxiv.2411.19103,
  title  = {VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models},
  author = {Jeongho Ju and Daeyoung Kim and SunYoung Park and Youngjune Kim},
  journal= {arXiv preprint arXiv:2411.19103},
  year   = {2024}
}

备注

24 pages, 15 figures, 4 tables. Model weights at https://huggingface.co/NCSOFT/VARCO-VISION-14B. Benchmarks released at NCSOFT's HuggingFace repositories (K-MMBench, K-SEED, K-MMStar, K-DTCBench, K-LLaVA-W). VARCO-VISION is an open-source Korean-English VLM with OCR, grounding, and referring capabilities