中文

基于置信水平的文本到图像模型微调奖励优化

机器学习 2024-04-03 v1 人工智能

摘要

使用基于人类反馈数据训练的奖励函数进行文本到图像模型的微调已被证明有效,用于与人类意图对齐。然而,对此类奖励模型进行过度优化——这些模型仅作为代理目标——会损害微调模型的性能,称为奖励过优化。为深入调查此问题,本文引入 Text-Image Alignment Assessment(TIA2)基准,包含多样化的文本提示、图像及人类标注。我们对多个最新奖励模型在该基准上的评估揭示了其频繁与人类评估不一致。我们经验性地证明,当使用误差较大的奖励模型作为微调目标时,过度优化尤为显著。为解决此问题,我们提出 TextNorm 方法,基于在一组语义对比文本提示上估计的奖励模型置信水平进行对齐增强。我们证明,在微调中纳入置信校准后的奖励可有效减少过优化,使文本-图像对齐的人类评估获胜次数约为基线奖励模型的两倍。

关键词

引用

@article{arxiv.2404.01863,
  title  = {Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models},
  author = {Kyuyoung Kim and Jongheon Jeong and Minyong An and Mohammad Ghavamzadeh and Krishnamurthy Dvijotham and Jinwoo Shin and Kimin Lee},
  journal= {arXiv preprint arXiv:2404.01863},
  year   = {2024}
}

备注

ICLR 2024