中文

FTibSuite:为藏语视觉语言模型构建综合资源套件

计算机视觉与模式识别 2026-05-27 v1

摘要

视觉语言模型已取得快速进展,但藏语仍因缺乏可复现的训练与评估基础设施而处于严重资源不足的低资源语言境。为填补这一空白,我们引入FTibSuite——为藏语视觉语言研究构建的综合资源套件,包含FTibData(覆盖持续预训练、图像-文本对齐及指令调优的人工验证多模态训练语料)、FTibBench(藏语版本的五大主流多模态基准测试,采用分层质量控制工作流程以减少翻译噪声)以及FTibVLM——基于Qwen3-VL-8B-Instruct构建的可复现基线,通过三阶段适应流程实现。在FTibBench上的实验表明,FTibVLM在所有任务中均实现了一致的性能提升,例如将MMBench准确率从42.97提升至67.78,将POPE-random准确率从47.53提升至80.56,同时保持原始中文能力,仅轻微退化,为藏语多模态研究提供了第一个标准化的基础设施。

关键词

引用

@article{arxiv.2605.26601,
  title  = {FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling},
  author = {Guixian Xu and Yide Liang and Zeli Su and Xuexian Song and Ziyin Zhang and Yushuang Dong and Ting Zhang and Xu Han},
  journal= {arXiv preprint arXiv:2605.26601},
  year   = {2026}
}