Panonut360:面向全景视频的头动与眼动追踪数据集
计算机视觉与模式识别
2024-03-27 v1 人机交互
多媒体
摘要
随着VR/AR技术的快速发展和广泛应用,最大化与用户个人偏好和习惯相匹配的沉浸式全景视频服务质量已成为一个长期挑战。基于头戴式显示器(HMD)收集的数据,理解用户关注的显著区域,可以促进多媒体编码、传输和质量评估。同时,大规模数据集对于研究人员和开发者探索短期/长期用户行为模式以及训练与全景视频相关的AI模型至关重要。然而,现有的全景视频数据集通常仅通过短期视频包含低频的用户头部或眼球运动数据,缺乏足够的数据来分析用户的视场(FoV)和生成视频显著区域。受这些实际因素的驱动,本文提出了一个头部和眼部追踪数据集,涉及50名用户(25名男性和25名女性)观看15个全景视频。该数据集提供了用户视口和注视注意力位置的详细信息。此外,我们展示了从数据集中提取的一些统计样本。例如,头部和眼球运动之间的偏差挑战了广泛持有的假设,即注视注意力从FoV中心开始呈高斯分布下降。我们的分析揭示,在涉及多个用户和视频的实验设置中,注视点相对于FoV存在一致的下偏移。这就是我们将数据集命名为Panonut的原因,即一种形状像甜甜圈的显著权重。最后,我们还提供了一个脚本,该脚本根据给定的头部或眼部坐标生成显著分布,以及从收集的眼动数据中为每个视频预生成的显著分布图集。该数据集可在网站https://dianvrlab.github.io/Panonut360/上获取。
引用
@article{arxiv.2403.17708,
title = {Panonut360: A Head and Eye Tracking Dataset for Panoramic Video},
author = {Yutong Xu and Junhao Du and Jiahe Wang and Yuwei Ning and Sihan Zhou Yang Cao},
journal= {arXiv preprint arXiv:2403.17708},
year = {2024}
}
备注
7 pages,ACM MMSys'24 accepted