基于去中心化区块链的鲁棒多智能体多臂老虎机
机器学习
2024-07-29 v2 多智能体系统
摘要
我们研究了一个鲁棒的(即存在恶意参与者的情况)多智能体多臂老虎机问题,其中多个参与者分布在一个完全去中心化的区块链上,并且其中一些可能是恶意的。对于诚实参与者而言,各臂的奖励是同质的,遵循时间不变的随机分布,并且仅当满足特定条件时才向参与者揭示,以确保协调机制足够安全。协调机制的目标是有效地确保诚实参与者获得的累积奖励最大化。为此,我们首次将区块链的先进技术以及新颖的机制引入到这种协作决策框架中,为诚实参与者设计最优策略。该框架允许各种恶意行为,并维护安全性和参与者隐私。更具体地说,我们选择了一组向所有参与者通信的验证者,为这些验证者设计了基于数字签名的新共识机制,发明了一种通过安全多方计算要求参与者提供较少信息的基于 UCB 的策略,并设计了链-参与者交互和激励机制以鼓励参与者的参与。值得注意的是,我们是首个证明所提出算法的理论遗憾界并声称其最优性的工作。与将区块链与联邦学习等学习问题集成且主要通过计算实验关注最优性的现有工作不同,我们证明了在某些假设下,诚实参与者的遗憾以 为上界。该遗憾界与多智能体多臂老虎机问题相一致,无论是在没有恶意参与者的情况下,还是在不影响整个系统的纯拜占庭攻击下。
引用
@article{arxiv.2402.04417,
title = {Decentralized Blockchain-based Robust Multi-agent Multi-armed Bandit},
author = {Mengfan Xu and Diego Klabjan},
journal= {arXiv preprint arXiv:2402.04417},
year = {2024}
}
备注
45 pages