中文

UniCorn:通过自生成监督实现自我改进的统一多模态模型

计算机视觉与模式识别 2026-01-09 v2 人工智能

摘要

尽管统一多模态模型(UMMs)在跨模态理解方面取得了显著成功,但在利用内部知识进行高质量生成方面仍存在显著差距。我们将这一差异形式化为Conduction Aphasia,即模型准确理解多模态输入但在将该理解转化为可靠且可控的合成方面困难。为解决这一问题,我们提出了UniCorn,一个简单而优雅的自我改进框架,无需外部数据或教师监督。通过将单个UMM划分为三个协作角色:Proposer、Solver和Judge,UniCorn通过自我对弈生成高质量互动,并采用认知模式重构将潜在理解蒸馏为显式生成信号。为验证多模态连贯性的恢复,我们引入了UniCycle,一个基于文本到图像到文本重建循环的循环一致性基准。广泛的实验表明,UniCorn在六个通用图像生成基准上实现了全面且显著的性能提升。尤其是在TIIF(73.8)、DPG(86.8)、CompBench(88.5)和UniCycle上实现了SOTA性能,同时在WISE上获得+5.0的提升,在OneIG上获得+6.5的提升。这些结果表明,我们的方法显著提升了文本到图像的生成,同时保持了稳健的理解,展示了完全自我监督精炼对于统一多模态智能的可扩展性。

关键词

引用

@article{arxiv.2601.03193,
  title  = {UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision},
  author = {Ruiyan Han and Zhen Fang and XinYu Sun and Yuchen Ma and Ziheng Wang and Yu Zeng and Zehui Chen and Lin Chen and Wenxuan Huang and Wei-Jie Xu and Yi Cao and Feng Zhao},
  journal= {arXiv preprint arXiv:2601.03193},
  year   = {2026}
}