语义优先于运动:一种语义优先的 360 度视口预测方法
多媒体
2026-01-12 v1
摘要
超高清 360 度视频流传输因提供沉浸式体验所需的巨大带宽而受到严重制约。当前的视口预测技术主要依赖运动学或低级视觉显著性,将用户视为受惯性支配的被动物理对象。这一理论局限性导致了“扫视陷阱”——一种关键的失败模式,预测器无法预期由意义驱动的注意力快速转移,恰好在用户参与度最高时导致重缓冲停滞。为解决此问题,我们提出了语义自适应共形分块与关联前瞻,一种将认知意图集成到网络控制中的新颖框架。与“一刀切”方法不同,我们的方法利用架构反转策略:将繁重的语义推理卸载到服务器以生成轻量级关联图,进而指导低延迟的客户端控制器。我们构建了一个个性化的多模态预测集,在稳定注视期间动态收紧安全裕度以最大化效率,同时预取包含语义关联对象的非相邻分块(关联前瞻)。该机制有效地将注视的“平静”转化为下一次交互的准备阶段。在 360-AV-HM 数据集上的轨迹驱动评估表明,该方法成功缓解了扫视陷阱,与最先进的基于轨迹的基线相比,将停滞持续时间减少了 20%,并将有效带宽消耗降低了 18%。
引用
@article{arxiv.2601.05416,
title = {Meaning over Motion: A Semantic-First Approach to 360{\deg} Viewport Prediction},
author = {Arman Nik Khah and Arvin Bahreini and Ravi Prakash},
journal= {arXiv preprint arXiv:2601.05416},
year = {2026}
}
备注
10 pages, 5 figures