中文

基于AI反馈的强化学习在多目标城市交通控制中的平衡

人工智能 2026-02-25 v1

摘要

奖励设计是实际强化学习(RL)部署的核心挑战之一,尤其是在多目标场景中。偏好基强化学习(Preference-based RL)通过学习行为结果的偏好对,提供了令人鼓舞的替代方案。近期,基于AI反馈的强化学习(RLAIF)已展示出大语言模型(LLM)可大规模生成偏好标签,显著减轻了对人类标注者的依赖。然而,现有RLAIF工作通常仅聚焦于单目标任务,留下了RLAIF如何处理涉及多目标的系统这一开放问题。在此类系统中,目标间存在相互冲突的权衡,策略风险倾向于聚焦单一目标。本文探讨了将RLAIF范式扩展至多目标自适应系统的可能性。我们表明,多目标RLAIF可生成在不同用户优先级下均衡的权衡,而无需繁琐的奖励工程。我们认为,将RLAIF集成到多目标RL中,为在目标本质上存在冲突的领域实现用户对齐的策略学习提供了可扩展的路径。

关键词

引用

@article{arxiv.2602.20728,
  title  = {Balancing Multiple Objectives in Urban Traffic Control with Reinforcement Learning from AI Feedback},
  author = {Chenyang Zhao and Vinny Cahill and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2602.20728},
  year   = {2026}
}