长时间尺度下的马尔可夫公平性学习:过去折扣的关键作用
人工智能
2026-02-03 v2 计算机科学与博弈论
多智能体系统
摘要
公平性是多智能体系统中动态资源分配的重要考虑因素。许多现有方法将公平性视为单次问题,忽略了随时间累积的不平等细微之处。最近的方法通过追踪时间上的分配来克服这一限制,假设对所有过去效用具有完美的记忆。虽然前者忽略了长期平等,但后者引入了一个关键挑战:用于追踪累积效用的增强状态空间随时间无限增长,阻碍了学习算法的可扩展性和收敛性。为了回应这一挑战,我们引入了一个框架,将过去折扣纳入学习问题中。这种方法在瞬时公平性和完美记忆公平性之间提供了原则性的插值。我们的核心贡献是引入过去折扣的框架用于记忆跟踪,并对公平记忆进行理论分析,表明过去折扣保证了有限且与时间尺度无关的状态空间,这一性质我们证明完美记忆方法不具备。这一结果使我们能够在任意长度时间尺度上可编程地学习公平策略。我们对该框架进行形式化建模,通过实验显示完美记忆在某些情况下失败,而过去折扣成功,并为构建可扩展且公平的资源分配系统提供了清晰的路径。
引用
@article{arxiv.2504.01154,
title = {Past-Discounting is Key for Learning Markovian Fairness with Long Horizons},
author = {Ashwin Kumar and William Yeoh},
journal= {arXiv preprint arXiv:2504.01154},
year = {2026}
}