中文

Lance:基于多任务协同的统一多模态建模

计算机视觉与模式识别 2026-05-21 v2 人工智能

摘要

我们提出了 Lance,一个轻量级的原生统一模型,支持图像和视频的多模态理解、生成与编辑。Lance 没有依赖模型容量扩展或以文本-图像为主导的设计,而是通过协作式多任务训练探索了一种统一多模态建模的实用范式。该范式基于两个核心原则:统一上下文建模和解耦的能力路径。具体而言,Lance 从头开始训练,并在共享的交错多模态序列上采用双流混合专家架构,从而在解耦理解与生成路径的同时实现联合上下文学习。我们进一步引入了模态感知旋转位置编码,以缓解异构视觉 token 之间的干扰并增强跨任务对齐。在训练过程中,Lance 采用了分阶段的多任务训练范式,结合面向能力的目标和自适应数据调度,以增强语义理解和视觉生成性能。实验结果表明,Lance 在图像和视频生成方面显著优于现有的开源统一模型,同时保留了强大的多模态理解能力。主页可在 https://lance-project.github.io 获取。

关键词

引用

@article{arxiv.2605.18678,
  title  = {Lance: Unified Multimodal Modeling by Multi-Task Synergy},
  author = {Fengyi Fu and Mengqi Huang and Shaojin Wu and Yunsheng Jiang and Yufei Huo and Hao Li and Yinghang Song and Fei Ding and Jianzhu Guo and Qian He and Zheren Fu and Zhendong Mao and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2605.18678},
  year   = {2026}
}

备注

34 pages, 14 figures, 10 tables, homepage url: https://lance-project.github.io , code url: https://github.com/bytedance/Lance