最优传输能否改进联邦逆强化学习?
计算机视觉与模式识别
2026-01-05 v1 人工智能
摘要
在机器人和多智能体系统中,fleet 的自主智能体常常在细微不同的环境中运行,同时追求共同的高层目标。由于环境差异、隐私限制和有限的通信带宽,直接汇聚其数据以学习共享奖励函数通常是不实用的。本文引入一种基于最优传输的方法用于联邦逆强化学习(IRL)。每个客户端首先进行轻量级的最大熵 IRL,以遵循其计算和隐私限制。随后,通过 Wasserstein 重心融合这些奖励函数,考虑其底层几何结构。我们进一步证明了该重心融合在联邦学习中比常规参数平均方法更能准确地估计全局奖励。总体而言,本工作为从事跨异构智能体和环境推导共享奖励提供了一个原则且通信高效的框架。
关键词
引用
@article{arxiv.2601.00307,
title = {VisNet: Efficient Person Re-Identification via Alpha-Divergence Loss, Feature Fusion and Dynamic Multi-Task Learning},
author = {Anns Ijaz and Muhammad Azeem Javed},
journal= {arXiv preprint arXiv:2601.00307},
year = {2026}
}