基于情节长度方差的时序可规划性
人工智能
2007-05-23 v1
摘要
随机环境中的决策问题优化通常关注最大化实现目标的概率和最小化预期情节长度。对于时间关键应用中的交互代理,学习子任务(事件)或整个任务的调度可能性是一个额外的相关问题。此外,存在高度随机的问题,其中实际轨迹在情节之间表现出很大差异,但完成任务所需的时间几乎相同。识别此类性质的子问题可以促进例如马尔可夫决策过程的规划、调度和分段。在这项工作中,推导了事件平均持续时间以及持续时间标准差的公式。所得到的 Bellman 型方程是 Sobel 工作(1982)的简单扩展。动态规划方法以及强化学习方法都可以应用于我们的扩展。在一个玩具问题上的计算机演示用于突出该原理。
引用
@article{arxiv.cs/0301006,
title = {Temporal plannability by variance of the episode length},
author = {Balint Takacs and Istvan Szita and Andras Lorincz},
journal= {arXiv preprint arXiv:cs/0301006},
year = {2007}
}