随机环境中的基于偏好规划:从偏序时间目标到最偏好策略
机器人学
2024-10-21 v2 人工智能
形式语言与自动机理论
计算机科学中的逻辑
摘要
人类偏好并不总是通过完全线性序来表示:使用偏序偏好来表达不可比较的结果是很自然的。在这项工作中,我们考虑在建模为马尔可夫决策过程(MDP)的随机系统中的决策和概率规划,给定一组时间扩展目标上的偏序偏好。具体地,每个时间扩展目标使用有限迹线性时序逻辑(LTL)公式表达。为了用偏序偏好进行规划,我们引入序理论将时间目标上的偏好映射到MDP策略上的偏好。相应地,随机序下的最偏好策略在MDP的有限路径上诱导出一个随机非支配概率分布。为了合成最偏好策略,我们的技术方法包括两个关键步骤。第一步,我们开发了一个过程,将时间目标上的偏序偏好转换为一个计算模型,称为偏好自动机,它是一个带有接受条件偏序的半自动机。第二步,我们证明找到最偏好策略等价于在从原始MDP、偏好自动机和所选随机序关系构建的多目标MDP中计算帕累托最优策略。在整篇论文中,我们使用运行示例来说明所提出的偏好规范和解方法。我们使用这些示例展示了算法的有效性,提供了详细分析,然后讨论了几个潜在的未来方向。
引用
@article{arxiv.2403.18212,
title = {Preference-Based Planning in Stochastic Environments: From Partially-Ordered Temporal Goals to Most Preferred Policies},
author = {Hazhar Rahmani and Abhishek N. Kulkarni and Jie Fu},
journal= {arXiv preprint arXiv:2403.18212},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2209.12267