用任务奖励调优计算机视觉模型
计算机视觉与模式识别
2023-02-17 v1
摘要
模型预测与预期用途之间的不一致会对计算机视觉模型的部署造成不利影响。当任务涉及复杂的结构化输出时,该问题会加剧,因为设计解决这种不一致的程序变得更加困难。在自然语言处理中,这通常使用强化学习技术来使模型与任务奖励对齐。我们采用了这种方法,并展示了其在多个计算机视觉任务(如目标检测、全景分割、上色和图像描述)中令人惊讶的有效性。我们认为这种方法有潜力被广泛用于更好地使模型与多样化的计算机视觉任务对齐。
引用
@article{arxiv.2302.08242,
title = {Tuning computer vision models with task rewards},
author = {André Susano Pinto and Alexander Kolesnikov and Yuge Shi and Lucas Beyer and Xiaohua Zhai},
journal= {arXiv preprint arXiv:2302.08242},
year = {2023}
}
备注
11 pages