面向可解释性的高阶智能体Q学习交互建模
计算机视觉与模式识别
2025-11-10 v3
摘要
建模智能体之间的交互对于有效的协调和理解其合作机制在多智能体强化学习(MARL)中至关重要。然而,以往尝试建模高阶交互的努力主要受制于组合爆炸或其黑箱网络结构的不可解释性。在本文中,我们提出了一种新型价值分解框架,称为Continued Fraction Q-Learning(QCoFr),可灵活地以仅线性复杂度(按智能体数量计)捕获任意阶的智能体交互,从而避免在建模丰富合作时出现组合爆炸。此外,我们引入变分信息瓶颈来提取用于估计信用的潜在信息。这种潜在信息帮助智能体过滤噪声交互,从而显著增强合作与可解释性。大量实验表明,QCoFr不仅始终实现更好的性能,还提供了与我们理论分析相一致的可解释性。
引用
@article{arxiv.2510.20217,
title = {EditInfinity: Image Editing with Binary-Quantized Generative Models},
author = {Jiahuan Wang and Yuxin Chen and Jun Yu and Guangming Lu and Wenjie Pei},
journal= {arXiv preprint arXiv:2510.20217},
year = {2025}
}
备注
28 pages, 13 figures, accepted by The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)