AIvaluateXR:面向XR设备的AI评估框架及基准测试结果
分布式、并行与集群计算
2026-05-14 v3 人工智能
图形学
人机交互
摘要
在扩展现实(XR)设备上部署大型语言模型(LLM)有巨大的潜力,推动人机交互领域的发展。就直接的、基于设备的模型推断而言,为特定任务选择合适的模型和设备仍然具有挑战性。本文提出AIvaluateXR,一个用于对在XR设备上运行的 LLM 进行评估的综合框架。为演示该框架,我们在四个XR平台上部署了17个选定的 LLM:Magic Leap 2、Meta Quest 3、Vivo X100s Pro 和 Apple Vision Pro,并进行了广泛的评估。我们的实验设置测量四个关键指标:性能一致性、处理速度、内存使用和电池消耗。对于每一对68个模型-设备组合,我们在不同字符串长度、批量大小和线程数下评估性能,分析实时XR应用的权衡。我们提出了基于3D Pareto 最优性理论的统一评估方法,用于从质量和速度目标中选择最佳的设备-模型组合。此外,我们比较了基于设备的 LLM 与客户端-服务器和云端设置的效率,并评估了其在两个交互式任务上的准确性。我们认为,自己的发现为指导未来的优化工作提供了有价值的见解,为LLM在XR设备上的部署奠定了坚实的基础。该评估方法可作为标准基础,用于进一步的研究和开发。源代码和补充材料可在 www.nanovis.org/AIvaluateXR.html 获取。
引用
@article{arxiv.2502.15761,
title = {AIvaluateXR: An Evaluation Framework for on-Device AI in XR with Benchmarking Results},
author = {Dawar Khan and Xinyu Liu and Omar Mena and Donggang Jia and Alexandre Kouyoumdjian and Ivan Viola},
journal= {arXiv preprint arXiv:2502.15761},
year = {2026}
}
备注
AIvaluateXR is updated version of LoXR