中文

RMLer:基于强化混合学习合成跨类别新颖对象

计算机视觉与模式识别 2025-12-23 v1

摘要

通过整合来自不同类别的 distinct textual concepts 来实现新颖对象合成,是文本到图像(Text-to-Image, T2I)生成中的重要挑战之一。现有方法常 suffer于概念混合不足、缺乏严谨评估和输出次优——表现为概念不平衡、浅层组合或单纯并置。为此,我们提出强化混合学习(Reinforcement Mixing Learning, RMLer)框架,将跨类别概念融合形式化为强化学习问题:混合特征作为状态,混合策略作为动作,视觉结果作为奖励。具体而言,我们设计了 MLP-策略网络以预测动态系数,用于混合跨类别文本嵌入。我们进一步引入基于(1)语义相似性和(2)构图平衡性的视觉奖励,以优化策略。推理时,选择策略利用这些奖励精选最高质量的融合对象。广泛实验表明,RMLer 在合成来自不同类别的连贯且高保真对象的能力方面显著优于现有方法。我们的工作为生成新颖视觉概念提供了稳健框架,具有广泛的应用前景,如电影、游戏和设计。

关键词

引用

@article{arxiv.2512.19300,
  title  = {RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning},
  author = {Jun Li and Zikun Chen and Haibo Chen and Shuo Chen and Jian Yang},
  journal= {arXiv preprint arXiv:2512.19300},
  year   = {2025}
}

备注

accepted by AAAI2026