Vintern-1B:面向越南语的高效多模态大语言模型
机器学习
2024-08-26 v2 计算与语言
摘要
本报告介绍了 Vintern-1B,这是一个可靠的 10 亿参数多模态大语言模型(MLLM),用于越南语语言任务。通过将 Qwen2-0.5B-Instruct 语言模型与 InternViT-300M-448px 视觉模型集成,Vintern-1B 针对各种应用进行了优化,包括光学字符识别(OCR)、文档提取以及越南语语境下的通用问答。该模型在超过 300 万张图像-问题-答案对的 dataset 上进行微调,实现了稳健且可靠的性能,在多个越南语语言基准测试(如 OpenViVQA 和 ViTextVQA)上取得良好成绩。Vintern-1B 参数量较小,能够轻松部署到各种嵌入式应用中。此外,我们开源了几个用于越南语视觉问答(VQA)数据集,包含文本和图表,由 Gemini 1.5 Flash 创建。我们的模型可在:https://huggingface.co/5CD-AI/Vintern-1B-v2 获取。
引用
@article{arxiv.2408.12480,
title = {Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese},
author = {Khang T. Doan and Bao G. Huynh and Dung T. Hoang and Thuc D. Pham and Nhat H. Pham and Quan T. M. Nguyen and Bang Q. Vo and Suong N. Hoang},
journal= {arXiv preprint arXiv:2408.12480},
year = {2024}
}