中文

面向下一代扩展现实系统的多模态多任务联邦基础模型

机器学习 2025-08-07 v4 人工智能 密码学与安全 多媒体

摘要

扩展现实 (XR) 系统由虚拟现实 (VR)、增强现实 (AR) 和混合现实 (XR) 组成,提供了沉浸式、多模态和具身人机交互的变革性界面。本文设想,多模态多任务 (M3T) 联邦基础模型 (FedFMs) 可以通过整合 M3T 基础模型 (FMs) 的表征能力与联邦学习 (FL) 的隐私保护模型训练原则,为 XR 系统提供变革性能力。我们提出一种模块化架构用于 FedFMs,其中包含针对模型训练和聚合的不同协调范式。我们的愿景核心在于对影响 FedFMs 在 SHIFT 维度下实现的 XR 挑战进行了编码:(1) 传感器和模态性多样性,(2) 硬件异构性和系统级约束,(3) 交互性和具身个性化,(4) 功能/任务可变性,(5) 时序性和环境可变性。我们在 XR 系统的若干新兴和预期应用中说明了这些维度的具体表现。最后,我们提出评估指标、数据集要求以及开发面向资源的 FedFMs 所必需的设计权衡。本篇视角旨在为下一代 XR 系统中的情境感知隐私保护智能奠定技术和概念基础。

关键词

引用

@article{arxiv.2506.05683,
  title  = {Multi-Modal Multi-Task Federated Foundation Models for Next-Generation Extended Reality Systems: Towards Privacy-Preserving Distributed Intelligence in AR/VR/MR},
  author = {Fardis Nadimi and Payam Abdisarabshali and Kasra Borazjani and Jacob Chakareski and Seyyedali Hosseinalipour},
  journal= {arXiv preprint arXiv:2506.05683},
  year   = {2025}
}

备注

16 pages, 4 Figures, 8 Tables