中文

TRAM:基于智能体混合的测试时风险适应

机器学习 2026-05-21 v2

摘要

部署中的强化学习智能体常常面临训练后才确定的安全要求,如新的危险地图、修订后的风险阈值或行为对齐约束。我们研究零更新部署时适应,其中在新指定的奖励-风险权衡下复用一组固定的风险中性源策略。我们提出TRAM(Test-Time Risk Adaptation via Mixture of Agents),一种源策略评分组成规则,对每个源策略在目标奖励和基于占用分布的部署风险下进行评估,然后使用风险调整后的源评分选择动作。与绑定于固定代理如收益方差的训练时风险敏感方法不同,TRAM支持空间屏障暴露、偏离参考行为的差异以及在测试时指定的局部波动风险。我们明确特征TRAM作为一种代理方法:它不求解缝合策略的完整占用控制问题,但容许可测量的源舱不匹配项,将源评分风险与实现风险联系起来。在网格世界、MuJoCo Reacher、Safety-Gymnasium以及LLM对齐设置的实验中显示,TRAM在不要求测试时进行任何参数更新的前提下,能够在保持奖励的同时降低部署风险。

关键词

引用

@article{arxiv.2408.08812,
  title  = {TRAM: Test-Time Risk Adaptation with Mixture of Agents},
  author = {Mohamad Fares El Hajj Chehade and Amrit Singh Bedi and Amy Zhang and Hao Zhu},
  journal= {arXiv preprint arXiv:2408.08812},
  year   = {2026}
}