中文

Phoenix-VL 1.5 Medium 技术报告

计算与语言 2026-05-12 v1 人工智能 计算机视觉与模式识别

摘要

我们介绍 Phoenix-VL 1.5 Medium,这是一个 1230 亿参数的原生多模态和多语言基础模型,针对区域语言和新加坡语境进行适配。作为主权 AI 资产,该模型展示了仅通过轻微损失即可实现深入领域适应的可能性。该模型在 Mistral Medium 3.1 上进行了针对本地化 1 万亿 token 多模态语料的继续预训练,随后进行了 2500 亿 token 的长上下文扩展阶段。后续训练阶段引入了新型的人工标注的新加坡多模态数据集和精选的文本语料,涵盖新加坡文化、知识和立法,总计 220 亿 token。还通过在线直接偏好优化 (Online Direct Preference Optimization) 进行了 50 亿 token 的模型对齐训练。Phoenix-VL 1.5 Medium 在新加坡多模态、法律和政府政策基准测试中实现了同类规模的最佳性能,同时在一般多模态智能、多语言和 STEM 基准测试中保持全球竞争力。我们还引入了一套新型评估套件,涵盖本地化知识基准测试,以及一个与机构协调一致的模型行为和安全框架。我们报告了数据 curated 原则、训练方法,并突出了基准测试和推理性能。

关键词

引用

@article{arxiv.2605.10391,
  title  = {Phoenix-VL 1.5 Medium Technical Report},
  author = {Team Phoenix and : and Arka Ray and Askar Ali Mohamed Jawad and Biondi Lee and Elijah Seah and Eva Lim and Fiona Teo and Grace Toh and Guang Xiang Teo and Jun En Tan and Jia Hui Bong and Jiale Wang and Jonathan Ng and Justin Tan and Kai Zhe Yew and Matthew Ong and Shun Yi Yeo and Wen Jett Lam and Wen Xiu Tan and Ze Yu Zhang and Gee Wah Ng and Chee Wee Ang and Mistral AI and : and Adrien Sadé and Guillaume Kunsch and Jia Sin Loh and Nicolas Schuhl and Rupert Menneer and Umar Jamil and Vincent Maladière and Yimu Pan},
  journal= {arXiv preprint arXiv:2605.10391},
  year   = {2026}
}

备注

Release page: https://medium.com/htx-ai/introducing-phoenix-vl-1-5-medium-multimodal-intelligence-uniquely-singaporean-ef8214c8cfa1