中文

SUDER:基于双自奖励的自我完善统一大型多模态模型理解与生成

人工智能 2025-09-09 v3 计算与语言 计算机视觉与模式识别

摘要

在大型语言模型(LLM)基础上,最近的大型多模态模型(LMM)试图统一跨模型的理解与生成。然而,LMM仍难以实现准确的视觉-语言对齐,容易生成与视觉输入矛盾的文本响应或未能遵循文本到图像提示。现有方法需要外部监督(如人类反馈或奖励模型),且仅解决单向任务——要么理解,要么生成。本文基于理解与生成在本质上是天然逆向双任务的观察,提出SUDER(S**elf**-improving **U**nified LMMs with **D**ual **E**lf-**R**ewards),一个以自我监督双奖励机制强化LMM理解与生成能力的框架。SUDER利用理解与生成任务之间的内在二义性,为彼此提供自我监督优化信号。具体而言,我们对给定输入在一个任务域中采样多个输出,然后反转输入-输出对,在模型内部计算双似然性作为优化的自奖励。大量实验结果表明,该方法能够在无需任何外部监督的情况下有效提升模型性能,尤其在文本到图像任务中取得显著改进。

关键词

引用

@article{arxiv.2506.07963,
  title  = {SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards},
  author = {Jixiang Hong and Yiran Zhang and Guanzhong Wang and Yi Liu and Ji-Rong Wen and Rui Yan},
  journal= {arXiv preprint arXiv:2506.07963},
  year   = {2025}
}