PRISM-XR:面向隐私敏感的 XR 协作多模态大语言模型
密码学与安全
2026-04-21 v1 人工智能
多媒体
摘要
多模态大语言模型 (MLLM) 通过结合自然语言和视觉输入,使 Extended Reality (XR) 环境中的协作更具灵活性,能够通过灵活的对象和动画创建实现协作。然而,XR 耳机捕获的视觉数据包括可能包含用户敏感信息的真实世界背景,例如桌上遗留的信用卡或其他用户的面部身份。将这些帧上传到基于云端的 MLLM 存在严重的隐私风险,尤其是当此类数据在未获用户明确同意的情况下被处理时。此外,现有的商业 XR API 中的协同和同步机制依赖于耗时的、侵入性的环境扫描,且难以适应高度动态的集成 MLLM 的 XR 环境。本文提出 PRISM-XR,一种新型框架,用于通过提供隐私感知的 MLLM 集成来促进 XR 中的多用户协作。PRISM-XR 在边缘服务器上采用智能帧预处理,以过滤敏感数据并删除无关上下文,然后与云端生成式 AI 模型通信。此外,我们引入一种轻量级注册流程和完全可定制的内容共享机制,以在用户之间实现高效、准确且隐私保护的内容同步。我们的数值评估结果表明,该平台在满足用户请求方面几乎达到 90% 的准确率,注册时间不到 0.27 秒,同时保持空间不一致性小于 3.5 cm。此外,我们对 28 名参与者进行了经过 IRB 批准的用户研究,表明该系统能够在超过 90% 的场景中自动过滤高度敏感对象,同时保持良好的整体可用性。
引用
@article{arxiv.2602.10154,
title = {PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models},
author = {Jiangong Chen and Mingyu Zhu and Bin Li},
journal= {arXiv preprint arXiv:2602.10154},
year = {2026}
}
备注
Accepted to the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR)