利用文本编码器强化学习增强扩散模型
计算机视觉与模式识别
2024-07-18 v2
摘要
文本到图像扩散模型通常训练以优化对数似然目标,这在满足下游任务(如图像美学与图文对齐)的特定要求方面存在挑战。近期研究通过强化学习或直接反向传播利用人类奖励来精炼扩散 U-Net 以解决此问题。然而,其中许多工作忽视了文本编码器的重要性,该编码器通常在训练中被预训练并固定。本文中,我们证明通过对文本编码器进行强化学习微调,可增强结果的图文对齐,从而改善视觉质量。我们的主要动机源于观察到当前文本编码器并非最优,常需谨慎的提示词调整。虽然微调 U-Net 可部分提升性能,但仍受限于次优的文本编码器。因此,我们提出使用基于任务特定奖励、结合低秩自适应的强化学习来微调文本编码器,称为 \textbf{TexForce}。我们首先表明微调文本编码器可改善扩散模型性能;继而说明 TexForce 可简单地与现有 U-Net 微调模型结合,无需额外训练即得远优结果;最后展示了我们的方法在多样应用中的适应性,包括高质量人脸与手部图像生成。
引用
@article{arxiv.2311.15657,
title = {Enhancing Diffusion Models with Text-Encoder Reinforcement Learning},
author = {Chaofeng Chen and Annan Wang and Haoning Wu and Liang Liao and Wenxiu Sun and Qiong Yan and Weisi Lin},
journal= {arXiv preprint arXiv:2311.15657},
year = {2024}
}
备注
ECCV2024