AuroraEdge-V-2B:更快更强的边缘视觉大语言模型
计算与语言
2026-01-26 v1
摘要
近年来,由于多模态技术的进步,人们正尝试将视觉大语言模型(VLLMs)应用于工业生产。许多部署在生产环境中的深度学习模型(DLMs)正逐渐被VLLMs取代。与DLMs相比,VLLMs在工业应用中具有一些优势:(1) 其强大的泛化能力使其在广泛的任务中表现良好。(2) 它们灵活,能通过上下文学习快速处理不熟悉的样本。然而,VLLMs也有明显的缺点:(1) VLLMs在特定领域的表现不如定制开发的DLMs。(2) VLLMs的参数数量通常相当大,其部署需要大量的计算资源。(3) VLLMs的运行速度通常远慢于DLMs,使得实时响应难以实现。为了更好地在工业应用中使用VLLMs,我们在本工作中介绍了AuroraEdge-V-2B,这是一个专为边缘部署设计的紧凑、鲁棒且高速的VLLM。为使模型运行更快,我们还提出了一种压缩融合方法来提高推理效率。AuroraEdge-V-2B具有以下显著特点:(1) 易于部署且更快:它仅有2B参数,非常适合边缘部署,提供更好的实时性能。(2) 更少的视觉token且更经济:它显著减少了解码过程中的视觉token数量,从而将推理过程中的浮点运算量减半,使其使用成本更低。(3) 性能强劲:在9个基准测试中,它获得了比同参数规模模型(如Qwen2-VL-2B、Qwen2.5-VL-3B、InternVL-2.5-2B)更高的分数。
引用
@article{arxiv.2601.16615,
title = {AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model},
author = {Xiang Chen},
journal= {arXiv preprint arXiv:2601.16615},
year = {2026}
}