中文

OIL-AD:面向序列决策序列的异常检测框架

机器学习 2024-02-08 v1 人工智能

摘要

由于正常性表示学习的复杂性以及任务的序列特性,决策序列中的异常检测是一个具有挑战性的问题。大多数基于强化学习 (RL) 的现有方法由于不切实际的假设(例如需要访问环境动态、奖励信号以及与环境的在线交互),难以在现实世界中实现。为了解决这些局限性,我们提出了一种名为基于离线模仿学习的异常检测 (OIL-AD) 的无监督方法,该方法使用提取的两个行为特征来检测决策序列中的异常:动作最优性和序列关联性。我们的离线学习模型是对采用 Transformer 策略网络的行为克隆的改进,其中我们修改了训练过程,以从正常轨迹中学习 Q 函数和状态值函数。我们提出 Q 函数和状态值函数可以提供关于智能体行为数据的充分信息,从中我们导出两个用于异常检测的特征。我们方法背后的直觉是,从 Q 函数导出的动作最优性特征可以在每个局部状态下将最优动作与其他动作区分开来,而从状态值函数导出的序列关联性特征有可能保持决策(状态-动作对)之间的时间相关性。我们的实验表明,OIL-AD 能够实现出色的在线异常检测性能,其 F1 分数比可比基线提高了 34.8%。

关键词

引用

@article{arxiv.2402.04567,
  title  = {OIL-AD: An Anomaly Detection Framework for Sequential Decision Sequences},
  author = {Chen Wang and Sarah Erfani and Tansu Alpcan and Christopher Leckie},
  journal= {arXiv preprint arXiv:2402.04567},
  year   = {2024}
}