中文

PLaMo 2.1-VL技术报告

计算机视觉与模式识别 2026-04-22 v1 人工智能

摘要

我们介绍PLaMo 2.1-VL,一个轻量级视觉语言模型(VLM),专为自动化设备设计,提供8B和2B变体,适用于本地和边缘部署,支持日语操作。聚焦于视觉问答(VQA)和视觉定位为核心能力,我们开发并评估了模型以应对两个实际场景:通过工具识别进行工厂任务分析,以及基础设施异常检测。我们还开发了一个大规模合成数据生成管道和全面的日语训练与评估资源。PLaMo 2.1-VL在日语和英文基准测试中超过相当数量的开源模型,实现JA-VG-VQA-500上的61.5 ROUGE-L,以及日本Ref-L4上的85.2%准确率。对于两个应用场景,工厂任务分析实现53.9%零样本准确率,针对电厂数据的微调可将异常检测边界框+标签F1分数从39.7提升至64.9。

关键词

引用

@article{arxiv.2604.19324,
  title  = {PLaMo 2.1-VL Technical Report},
  author = {Tommi Kerola and Yuya Masuda and Takashi Masuko and Toshiki Nakanishi and Daisuke Nishino and Kuniyuki Takahashi and Hanqin Wang and Yoshihiro Yamada},
  journal= {arXiv preprint arXiv:2604.19324},
  year   = {2026}
}

备注

35 pages, 9 figreus