中文

TIE:用于事件视频生成的时间间隔编码

计算机视觉与模式识别 2026-05-26 v2

摘要

导演式提示、机器人动作预测以及交互式视频代理都要求对并发事件进行时间定位 grounding —— 在这种 regime 中,68% 的常规片段和超过 99% 的机器人/游戏片段包含重叠事件,但现有的多事件生成器仍基于单活跃提示假设。然而,现代视频生成器,如扩散转换器(DiT),通过点状位置编码将时间离散化为离散点。这种表述造成了根本的维度不匹配: temporally 扩展的间隔和重叠事件在注意力机制中无法被数学表示。本文提出时间间隔编码(TIE),这是一种原则且即插即用的间隔感知 rotary 嵌入的广义形式,将时间间隔提升为 DiT 跨注意力中的一等公民。Rather than 引入另一种启发式间隔嵌入,我们展示在 RoPE 兼容的双线性注意力中,TIE 由两个基本原则描述:时间可积性要求事件在其完整持续时间内聚合位置证据,持续时间不变性消除了对更长间隔的平凡偏好。在均匀核下,这一表述导出一种高效的闭式 sinc 基于解,保留标准注意力接口,并通过间隔积分自然减弱边界噪声。经验上,TIE 保留基础 DiT 模型的视觉质量,同时显著提高时间可控性。在 OmniEvents 数据集上的实验中,它将人类验证的时间约束满足率从 77.34% 提升至 96.03%,将时间边界误差从 0.261s 降至 0.073s,同时改善轨迹级时间对齐指标。代码和数据集已提供至 https://github.com/MatrixTeam-AI/TIE。

关键词

引用

@article{arxiv.2605.10543,
  title  = {TIE: Time Interval Encoding for Video Generation over Events},
  author = {Zhilei Shu and Shangwen Zhu and Zihang Liang and Xiaofan Li and Qianyu Peng and Xinyu Cui and Bo Ye and Yiming Li and Fan Cheng and Jian Zhao and Yang Cao and Zheng-Jun Zha and Ruili Feng},
  journal= {arXiv preprint arXiv:2605.10543},
  year   = {2026}
}