中文

学习奖励而非标签:基于对抗性逆向强化学习的机械故障检测

机器学习 2026-02-27 v1 人工智能

摘要

强化学习(RL)为机械故障检测(MFD)提供了巨大的潜力。然而,大多数现有的基于 RL 的 MFD 方法并未充分发挥 RL 的序列决策优势,常常将 MFD 视为简单的猜测游戏(情境式精英)。为弥合这一差距,本文将 MFD 表述为一个离线逆向强化学习问题,智能体直接从健康运行序列中学习奖励动力学,从而绕开手动奖励工程和故障标签的需求。我们的框架采用对抗性逆向强化学习来训练判别器,以区分正常(专家)与策略生成的转换。判别器所学习的奖励作为异常评分,指示偏离正常运行行为的程度。在三个运行到失效基准数据集(HUMS2023、IMS 和 XJTU-SY)上进行评估,该模型在正常样本上始终分配低异常评分,在故障样本上分配高评分,实现了早期且稳健的故障检测。通过将 RL 的序列推理与 MFD 的时序结构相结合,本工作为数据驱动的工业环境中的 RL 诊断开辟了一条道路。

关键词

引用

@article{arxiv.2602.22297,
  title  = {Learning Rewards, Not Labels: Adversarial Inverse Reinforcement Learning for Machinery Fault Detection},
  author = {Dhiraj Neupane and Richard Dazeley and Mohamed Reda Bouadjenek and Sunil Aryal},
  journal= {arXiv preprint arXiv:2602.22297},
  year   = {2026}
}

备注

This article is accepted to be published in AAMAS2026. The doi is listed below but the production is on the way as of now (26/02/2026)