通过结合奖励塑形与课程学习的多智能体强化学习实现最优组织修复
机器学习
2025-04-16 v1 人工智能
多智能体系统
摘要
在本文中,我们提出了一个多智能体强化学习(MARL)框架,利用工程化生物智能体优化组织修复过程。我们的方法集成了:(1) 描述分子信号的随机反应-扩散系统,(2) 具有 Hebbian 可塑性的类神经电化学通信,以及 (3) 结合化学梯度跟踪、神经同步和鲁棒性惩罚的生物启发奖励函数。课程学习方案引导智能体经历由浅入深的复杂修复场景。计算机模拟实验展示了涌现的修复策略,包括动态分泌物控制和空间协调。
引用
@article{arxiv.2504.10677,
title = {Achieving Optimal Tissue Repair Through MARL with Reward Shaping and Curriculum Learning},
author = {Muhammad Al-Zafar Khan and Jamal Al-Karaki},
journal= {arXiv preprint arXiv:2504.10677},
year = {2025}
}
备注
14 pages, 4 figures, submitted to the 10th International Conference on Information and Communication Technology for Intelligent Systems (ICTIS)