YRC-Bench:用于学习与专家协作的基准
机器学习
2026-01-14 v3 机器学习
摘要
在实际部署中,AI 代理必然会面临超出自身能力范围的挑战。AI 安全的关键组成部分在于代理识别自己在新情境中可能失败并转向更高效能专家系统的能力。利用专家帮助可以显著提高此类情境下的安全性和性能。由于专家帮助成本高昂,核心挑战在于何时向专家寻求帮助。本文探讨了此问题的一种新变体,即 YRC-0,在该变体中,代理必须以无监督方式学习如何与新环境中的专家合作——即在训练期间无需与专家交互。此设置促使开发低成本、稳健的方法来训练能够利用专家的代理。为支持此领域的研究,我们引入 YRC-Bench,一个跨越多种环境的开源基准。YRC-Bench 提供标准化的 Gym-like API、模拟专家、评估管道以及流行基线方法的实现。为应对 YRC-0,我们提出了一种验证策略,并使用提议-验证器分解作为诊断框架来评估一系列学习方法,为未来研究提供了见解。代码仓库:https://github.com/modanesh/YRC-Bench
引用
@article{arxiv.2502.09583,
title = {YRC-Bench: A Benchmark for Learning to Coordinate with Experts},
author = {Mohamad H. Danesh and Nguyen X. Khanh and Tu Trinh and Benjamin Plaut},
journal= {arXiv preprint arXiv:2502.09583},
year = {2026}
}
备注
Accepted at TMLR