中文

基于测试驱动的连续控制强化学习

机器学习 2025-12-10 v3 人工智能

摘要

强化学习 (RL) 被认作是机器人控制任务的强大工具。RL 通常采用奖励函数来定义任务目标并指导智能体学习。然而,由于奖励函数同时承担定义最优目标与指导学习的双重职责,手动设计奖励函数往往困难,导致任务表示次优。为解决 RL 中的奖励设计挑战,本文灵感来源于满足准则理论,提出 Test-driven Reinforcement Learning (TdRL) 框架。在 TdRL 框架中,多个测试函数用于表示任务目标,而非单一奖励函数。测试函数可分为通过-失败测试与指示性测试,分别用于定义最优目标与指导学习过程,从而简化任务定义。基于此任务定义,本文首先证明:若轨迹回报函数对距离最优轨迹集合更近的轨迹赋予更高回报,则基于该回报函数进行的最大熵策略优化将得到更接近最优策略集合的策略。随后,本文引入字典序启发方法来比较轨迹与最优轨迹集合之间相对距离关系,以学习轨迹回报函数。进一步,我们实现了 TdRL 的算法。在 DeepMind Control Suite 基准测试中,实验结果表明,TdRL 在策略训练方面与手工设计奖励方法持平或优于,同时展现更大的设计简洁性与对多目标优化的内在支持。我们认为 TdRL 为 RL 应用中的任务目标表示提供了一种新视角,有助于解决奖励设计挑战。

关键词

引用

@article{arxiv.2511.07904,
  title  = {Test-driven Reinforcement Learning in Continuous Control},
  author = {Zhao Yu and Xiuping Wu and Liangjun Ke},
  journal= {arXiv preprint arXiv:2511.07904},
  year   = {2025}
}

备注

AAAI 2026 oral