基于加权时序逻辑的安全最优偏好学习及其在机器人和 Formula 1 中的应用
机器人学
2026-03-12 v2 系统与控制
系统与控制
摘要
自动化系统越来越依赖人类反馈来对齐其行为,表达方式包括两两比较、排序或演示。虽然现有方法能够调整行为,但往往无法在安全关键领域保证安全。我们提出了一种安全保证、最优且高效的方法,用于解决基于偏好、排序或演示的学习问题,方法使用加权信号时序逻辑(Weighted Signal Temporal Logic, WSTL)。当 WSTL 学习问题被直观实现时,会导致要学习的权重上的多项式约束。通过引入结构剪枝和对数变换程序,我们缩小问题规模,并将其重塑为混合整数线性规划(Mixed-Integer Linear Program),同时保持安全保证。在机器人导航和真实世界的 Formula 1 数据实验中,结果表明该方法能够捕捉到细微的偏好,并建模复杂的任务目标。
引用
@article{arxiv.2511.08502,
title = {Safe and Optimal Learning from Preferences via Weighted Temporal Logic with Applications in Robotics and Formula 1},
author = {Ruya Karagulle and Cristian-Ioan Vasile and Necmiye Ozay},
journal= {arXiv preprint arXiv:2511.08502},
year = {2026}
}
备注
8 pages, 2 figures