中文

Xuanwu:将通用多模态模型演化为内容生态系统的工业级基础模型

人工智能 2026-04-01 v1 计算与语言 计算机视觉与模式识别

摘要

近年来,多模态大模型在通用基准测试上持续取得进步。然而,在现实世界的内容 moderation 和对抗情境中,主流模型仍因细粒度视觉感知不足和对长尾噪声建模不足,导致泛化性能下降和灾难性遗忘。在本文中,我们以 Xuanwu VL-2B 为案例研究,展示如何将通用多模态模型开发为内容生态系统的工业级基础模型。该模型采用紧凑的 InternViT-300M + MLP + Qwen3 1.7B 架构,在约 20 亿参数预算内平衡细粒度视觉感知、语言语义对齐和部署成本。为平衡业务专业化与通用能力保留,我们开发了数据迭代和精选机制,并通过三个阶段的训练流程进行训练:预训练、中期训练和后期训练。消融研究和离线业务评估表明,Xuanwu VL-2B 在七项 OpenCompass 多模态指标上平均得分为 67.90(相较于 InternVL 3.5 2B 的 64.27),在七个独立业务 moderation 任务中实现 94.38% 的平均召回率,在具有挑战性的对抗 OCR 场景中对政策违规文本的加权总召回率为 82.82%,超越 Gemini-2.5-Pro (76.72%)。这些结果表明,在有限的参数预算下,Xuanwu VL-2B 在业务对齐、视觉感知、通用能力保留和部署成本方面实现了实用的平衡。

关键词

引用

@article{arxiv.2603.29211,
  title  = {Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems},
  author = {Zhiqian Zhang and Xu Zhao and Xiaoqing Xu and Guangdong Liang and Weijia Wang and Xiaolei Lv and Bo Li and Jun Gao},
  journal= {arXiv preprint arXiv:2603.29211},
  year   = {2026}
}

备注

41 pages, 10 figures