OS-Themis:面向通用 GUI 奖励的可扩展评判框架
人工智能
2026-03-20 v1
摘要
强化学习 (RL) 有望提高 GUI 代理在随机环境中的鲁棒性,但训练对奖励函数的质量高度敏感。现有奖励方法难以实现可扩展性与性能的平衡。为此,我们提出 OS-Themis,一个可扩展且精确的多代理评判框架。不同于单一评判器,OS-Themis 将轨迹分解为可验证的里程碑,以隔离决策关键证据,并通过审查机制严格审核证据链后再作最终判断。为便于评估,我们进一步引入 OmniGUIRewardBench (OGRBench),一个覆盖跨平台的 GUI 结果奖励综合基准测试,其中所有评估模型在 OS-Themis 条件下均取得最佳性能。大量实验表明,在 AndroidWorld 上使用 OS-Themis 支持在线 RL 训练可提升 10.3%,在自训练循环中用于轨迹验证和过滤可提升 6.9%,凸显其推动代理演化的潜力。
引用
@article{arxiv.2603.19191,
title = {OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards},
author = {Zehao Li and Zhenyu Wu and Yibo Zhao and Bowen Yang and Jingjing Xie and Zhaoyang Liu and Zhoumianze Liu and Kaiming Jin and Jianze Liang and Zonglin Li and Feng Wu and Bowen Zhou and Zun Wang and Zichen Ding},
journal= {arXiv preprint arXiv:2603.19191},
year = {2026}
}