面向消费级网络晕动:面向实时视觉唯一推断的多模型对齐
计算机视觉与模式识别
2025-08-19 v3 人机交互
摘要
网络晕动仍是沉浸式虚拟现实(VR)在消费级环境中广泛采用的主要障碍。尽管先前方法依赖于电脑神经活动(EEG)等侵入性信号可实现高预测精度,但这些方法需要专业硬件,在实际应用中不够实用。本文提出了一个可扩展、可部署的框架,用于仅利用来自商业VR头盔的非侵入信号(包括头部运动、眼动和生理反应)进行个性化网络晕动预测。我们的模型采用特定于模态的图神经网络,并增强了差分注意力模块,以提取捕获跨模态动态变化的时空嵌入。跨模态对齐模块联合训练视频编码器,通过对齐视频特征与传感器派生表示来学习个性化特征。因此,模型仅使用视频输入即可准确预测个体网络晕动。实验结果表明,我们的模型达到了88.4%的准确率, closely matching EEG-based approaches(89.16%),同时降低了部署复杂度。平均推断延迟为90ms,使我们的框架支持实时应用,适合集成到消费级VR平台中,而不影响个性化或性能。代码将发布在https://github.com/U235-Aurora/PTGNN。
引用
@article{arxiv.2501.01212,
title = {Towards Consumer-Grade Cybersickness Prediction: Multi-Model Alignment for Real-Time Vision-Only Inference},
author = {Yitong Zhu and Zhuowen Liang and Yiming Wu and Tangyao Li and Yuyang Wang},
journal= {arXiv preprint arXiv:2501.01212},
year = {2025}
}