FedCVU:面向跨视角视频理解的联邦学习
计算机视觉与模式识别
2026-03-24 v1 机器学习
摘要
联邦学习(FL)已成为一种用于隐私保护的多摄像头视频理解的有前景的范式。然而,将联邦学习应用于跨视角场景面临三大挑战:(i) 异构的视角和背景导致高度非独立同分布(non-IID)的客户端分布,并过度拟合特定视角的模式;(ii) 局部分布偏差导致表示不对齐,阻碍了跨视角语义的一致性;(iii) 大型视频架构带来难以承受的通信开销。为解决这些问题,我们提出了 FedCVU,一个包含三个组件的联邦框架:VS-Norm,通过保留归一化参数来处理特定视角的统计特性;CV-Align,一个轻量级的对比正则化模块,用于改善跨视角表示对齐;以及 SLA,一种选择性层聚合策略,可在不牺牲精度的情况下减少通信量。在跨视角协议下对动作理解和行人重识别任务进行的大量实验表明,FedCVU 在保持强大的已见视角性能的同时,持续提升了未见视角的准确率,优于最先进的联邦学习基线,并展现出对领域异构性和通信约束的鲁棒性。
引用
@article{arxiv.2603.21647,
title = {FedCVU: Federated Learning for Cross-View Video Understanding},
author = {Shenghan Zhang and Run Ling and Ke Cao and Ao Ma and Zhanjie Zhang},
journal= {arXiv preprint arXiv:2603.21647},
year = {2026}
}