中文

Shakti-VLMs:面向企业级 AI 的可扩展视觉-语言模型

计算机视觉与模式识别 2025-10-20 v1 计算与语言

摘要

我们提出了 Shakti VLM,一个具有 1B 和 4B 参数规模的视觉-语言模型家族,旨在解决多模态学习中的数据效率挑战。尽管近期的视觉-语言模型通过大量训练数据取得了强劲的性能,Shakti 模型利用架构创新以更少的 token 取得了有竞争力的结果。关键进展包括用于注意力稳定性的 QK-Normalization、混合归一化技术以及增强的位置编码。三阶段训练策略进一步优化了学习效率。评估结果表明,Shakti-Shakti-VLM-1B 和 Shakti-VLM-4B 在文档理解、视觉推理、OCR 提取和一般多模态推理方面表现出色。我们的结果强调,通过模型设计和训练策略而非单纯依赖数据量即可实现高性能,这使得 Shakti 成为面向企业级多模态任务的高效解决方案。

关键词

引用

@article{arxiv.2502.17092,
  title  = {Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI},
  author = {Syed Abdul Gaffar Shakhadri and Kruthika KR and Kartik Basavaraj Angadi},
  journal= {arXiv preprint arXiv:2502.17092},
  year   = {2025}
}