IO Transformer:评估基于SwinV2的计算机视觉奖励模型
计算机视觉与模式识别
2024-11-04 v1 机器学习
摘要
变换器及其衍生模型已在文本、视觉和语音识别任务中取得了最先进的性能。然而,针对训练能够评估其他模型输出质量的变换器所付出的努力极少。本文研究了基于SwinV2的奖励模型,即输入-输出变换器(IO Transformer)和输出变换器。这些奖励模型可用于推理质量评估、数据分类和策略优化等任务。实验结果表明,在输出完全依赖于输入的各个领域中,这些奖励模型能够实现高度准确的模型输出质量评估,其中IO Transformer在Change Dataset 25 (CD25)上达到了完美评估精度。我们还探索了修改后的Swin V2架构。最终Swin V2在IO Segmentation Dataset上以95.41%的得分位居榜首,在输出不完全依赖于输入的场景中优于IO Transformer。本工作拓展了变换器架构在计算机视觉奖励建模中的应用,并为针对不同任务优化这些模型提供了关键见解。
引用
@article{arxiv.2411.00252,
title = {IO Transformer: Evaluating SwinV2-Based Reward Models for Computer Vision},
author = {Maxwell Meyer and Jack Spruyt},
journal= {arXiv preprint arXiv:2411.00252},
year = {2024}
}
备注
15 pages, 3 figures, 2 tables