通过从时序数据中学习行动来推荐最优策略
人工智能
2025-07-25 v1
摘要
处方过程监控是过程挖掘中的一个突出问题,其目的在于识别一组待推荐的动作,以优化感兴趣的目标度量或关键绩效指标(KPI)。使该问题困难的一个挑战在于,由于缺乏精心构建且经人工验证的显式模型,需要提供仅基于时序标注的(过程)执行数据(存储于所谓的执行日志中)的处方过程监控技术。本文旨在提出一种基于 AI 的方法,该方法通过强化学习(RL)从(几乎)仅对过去执行的观察中学习最优策略,并推荐为优化感兴趣 KPI 而应执行的最佳活动。这首先通过从数据学习特定 KPI 的马尔可夫决策过程,然后利用 RL 训练学习最优策略来实现。该方法在真实与合成数据集上得到验证,并与离策略深度 RL 方法进行比较。我们的方法与深度 RL 方法可比且常优于之的能力,为在仅有时序执行数据可用的场景中利用白盒 RL 技术作出了贡献。
引用
@article{arxiv.2303.09209,
title = {Recommending the optimal policy by learning to act from temporal data},
author = {Stefano Branchi and Andrei Buliga and Chiara Di Francescomarino and Chiara Ghidini and Francesca Meneghello and Massimiliano Ronzani},
journal= {arXiv preprint arXiv:2303.09209},
year = {2025}
}
备注
10 pages, 5 figures