基于自回归扩散模型的无限视线生成
计算机视觉与模式识别
2026-03-27 v1
摘要
预测视频中的人类视线是推进场景理解和多模态交互的基本任务。虽然传统的显著图提供了空间概率分布,扫描路径则提供了有序的注视点,但这两种抽象方法往往压缩了原始视线的细粒度时序动力学。此外,现有模型通常受限于短期时间窗口(约3-5秒),无法捕捉真实场景内容中固有的长程行为依赖。我们提出了一个用于生成任意视频长度上原始视线预测的生成框架。通过利用自回归扩散模型,我们合成具有连续空间坐标和高分辨率时间戳的视线轨迹。我们的模型基于显著性感知的视觉潜在空间进行条件化。定量和定性评估表明,我们的方法在长程时空精度和轨迹真实性方面显著优于现有方法。
引用
@article{arxiv.2603.24938,
title = {Infinite Gaze Generation for Videos with Autoregressive Diffusion},
author = {Jenna Kang and Colin Groth and Tong Wu and Finley Torrens and Patsorn Sangkloy and Gordon Wetzstein and Qi Sun},
journal= {arXiv preprint arXiv:2603.24938},
year = {2026}
}