基于仪器赋能的多智能体强化学习中的动作效应理解
人工智能
2025-08-26 v2 信息论
机器学习
多智能体系统
math.IT
摘要
可靠部署多智能体强化学习(MARL)系统,关键在于理解单个智能体的行为。虽然先前工作通常基于明确的奖励信号评估整体团队性能,但在缺乏价值反馈时,如何推断智能体贡献尚不清晰。本文探讨了是否可仅通过分析策略分布来提取对智能体行为的有意义见解。受到智能体倾向于追求收敛仪器价值这一现象的启发,我们引入意图合作价值(ICVs),一种基于信息论Shapley值的方法,用于量化每个智能体对其协作者仪器赋能的因果影响。具体而言,ICVs通过评估其决策(不)确定性和偏好对齐来衡量智能体对同伴策略的行动效应。通过分析合作与竞争MARL任务中策略与价值函数的行动效应,我们的 метод识别出哪些智能体行为有助于团队成功 —— 要么通过促进确定性决策,要么通过保持未来行动选择的灵活性 —— 同时揭示智能体采用相似或多样化策略的程度。我们提出的方法为MARL系统的合作动态提供新视角,并增强了其可解释性。
引用
@article{arxiv.2508.15652,
title = {Understanding Action Effects through Instrumental Empowerment in Multi-Agent Reinforcement Learning},
author = {Ardian Selmonaj and Miroslav Strupl and Oleg Szehr and Alessandro Antonucci},
journal= {arXiv preprint arXiv:2508.15652},
year = {2025}
}
备注
European Conference on Artificial Intelligence (ECAI) 2025