基于强化学习的自修复材料系统
机器学习
2025-11-25 v1
摘要
向自主材料系统转型势在必然,亟需适应性控制方法以最大化结构寿命。本研究将自修复过程建模为强化学习(Reinforcement Learning, RL)问题,基于马尔可夫决策过程(Markov Decision Process, MDP),使智能体能够自主推导高效平衡结构完整性维护与有限资源消耗的最优策略。我们在随机仿真环境中,对离散动作(Q学习、DQN)与连续动作(TD3)代理进行比较评估,结果显示RL控制器显著优于启发式基线,实现近乎完整的材料恢复。关键在于,采用连续剂量控制的TD3代理在收敛速度与稳定性方面表现优异,凸显了动态自修复应用中精细化、比例式驱动的必要性。
引用
@article{arxiv.2511.18728,
title = {Reinforcement Learning for Self-Healing Material Systems},
author = {Maitreyi Chatterjee and Devansh Agarwal and Biplab Chatterjee},
journal= {arXiv preprint arXiv:2511.18728},
year = {2025}
}
备注
Accepted to INCOM 2026. This is the camera-ready version