中文

基于像素到标记的图像子词编码

机器学习 2025-11-26 v2 计算几何 机器学习

摘要

多模态大语言模型在整合视觉和文本信息方面取得了显著进展,但往往难以有效对齐这些模态。我们引入了一种新型图像标记器,通过将字节对编码 (BPE) 的原理应用于视觉数据来弥合这一鸿沟。不同于传统方法依赖独立视觉编码器的做法,我们的方法直接将结构先验信息纳入图像标记中,模仿文本专用大语言模型中成功的标记策略。这种创新方法使 Transformer 模型能够更有效地跨模态学习和推理。通过理论分析和大量实验,我们展示了我们的 BPE 图像标记器在有限训练数据下显著增强了多模态大语言模型的理解能力。基于此方法,我们开发了 Being-VL-0 模型,展示了在各种基准测试中的卓越性能,并显示出良好的可扩展性, potentially 为更高效和更具能力的多模态基础模型铺平了道路。

关键词

引用

@article{arxiv.2410.02158,
  title  = {SCNode: Spatial and Contextual Coordinates for Graph Representation Learning},
  author = {Md Joshem Uddin and Astrit Tola and Varin Sikand and Cuneyt Gurcan Akcora and Baris Coskunuzer},
  journal= {arXiv preprint arXiv:2410.02158},
  year   = {2025}
}

备注

24 pages, 5 figures