基于分块分类与多模态融合Transformer的视口预测
计算机视觉与模式识别
2025-06-18 v5 多媒体
摘要
视口预测是基于分块的360度视频流系统的关键方面。然而,现有的基于轨迹的方法缺乏鲁棒性,且过度简化了不同模态输入之间的信息构建与融合过程,导致误差累积问题。本文提出一种基于分块分类的视口预测方法,采用多模态融合Transformer(MFTR)。具体而言,MFTR利用基于Transformer的网络提取各模态内的长程依赖,进而挖掘模态内与模态间关系,以捕获用户历史输入与视频内容对未来视口选择的联合影响。此外,MFTR将未来分块分为两类:用户感兴趣与不感兴趣,并选择包含最多用户感兴趣分块的区域作为未来视口。与预测头部轨迹相比,基于分块二分类结果选择未来视口展现出更好的鲁棒性与可解释性。为评估所提出的MFTR,我们在两个广泛使用的PVS-HM和Xu-Gaze数据集上进行了大量实验。MFTR在平均预测准确率和重叠率方面优于现有最优方法,并展现出具有竞争力的计算效率。
引用
@article{arxiv.2309.14704,
title = {Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer},
author = {Zhihao Zhang and Yiwei Chen and Weizhan Zhang and Caixia Yan and Qinghua Zheng and Qi Wang and Wangdu Chen},
journal= {arXiv preprint arXiv:2309.14704},
year = {2025}
}
备注
This paper is accepted by ACM-MM 2023