中文

POCA:面向视觉文本生成的帕累托最优课程对齐

计算机视觉与模式识别 2026-04-28 v1

摘要

当前视觉文本生成模型在文本准确性与整体图像一致性之间存在权衡。我们发现,实现高文本准确性可能会降低审美质量和指令跟随能力。虽然强化学习方法可通过与多个奖励对齐来缓解这一问题,但它们通常对文本生成不稳定,因为现有方法通常以加权求和方式优化多个奖励。此外,平衡每个奖励的权重很难。而且,强化学习需要一组训练指令。大量提示需要更多训练时间和计算资源,而小组则导致性能差。因此,如何选择高效训练的提示是一个未解决的问题。在本研究中,我们提出了帕累托最优课程对齐 (POCA),一个框架将此问题作为多目标问题:1) 识别帕累托最优集以避免简单标量化;2) 设计自适应课程对齐策略以管理多奖励数据集的学习序列,使用自动难度评估,这对于在有限数据环境中进行 RL 方法的 optimal 收敛至关重要。综上,POCA 在统一的奖励空间中找到帕累托最优集,这消除了不一致的信号,在易于硬的优化景观中寻找来自不同奖励的最佳权衡解决方案。实验结果表明,POCA 显著改进了所有指标,如 CLIP、HPS 分数和句子准确率。

关键词

引用

@article{arxiv.2604.24171,
  title  = {POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation},
  author = {Yaohou Fan and Qingzhong Wang and Yongsong Huang and Junyi Liu and Tomo Miyazaki and Shinichiro Omachi},
  journal= {arXiv preprint arXiv:2604.24171},
  year   = {2026}
}

备注

Accepted by CVPR 2026