中文

基于加权时序逻辑的安全最优偏好学习及其在机器人和 Formula 1 中的应用

机器人学 2026-03-12 v2 系统与控制 系统与控制

摘要

自动化系统越来越依赖人类反馈来对齐其行为,表达方式包括两两比较、排序或演示。虽然现有方法能够调整行为,但往往无法在安全关键领域保证安全。我们提出了一种安全保证、最优且高效的方法,用于解决基于偏好、排序或演示的学习问题,方法使用加权信号时序逻辑(Weighted Signal Temporal Logic, WSTL)。当 WSTL 学习问题被直观实现时,会导致要学习的权重上的多项式约束。通过引入结构剪枝和对数变换程序,我们缩小问题规模,并将其重塑为混合整数线性规划(Mixed-Integer Linear Program),同时保持安全保证。在机器人导航和真实世界的 Formula 1 数据实验中,结果表明该方法能够捕捉到细微的偏好,并建模复杂的任务目标。

关键词

引用

@article{arxiv.2511.08502,
  title  = {Safe and Optimal Learning from Preferences via Weighted Temporal Logic with Applications in Robotics and Formula 1},
  author = {Ruya Karagulle and Cristian-Ioan Vasile and Necmiye Ozay},
  journal= {arXiv preprint arXiv:2511.08502},
  year   = {2026}
}

备注

8 pages, 2 figures