中文

面向语义一致的插值:锚定注意力与时间尺度重缩放

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

生成式插值(GI)旨在合成第一个和最后一个关键帧之间的真实中间帧,超越简单的插值。随着序列变稀和运动变大,之前的GI模型在帧率不稳定和语义错位的情况下难以处理。由于GI涉及固定端点和众多可能的路径,该任务需要从关键帧和文本获取额外的指导,以指定预期的路径。因此,我们通过关键帧锚定注意力偏置,将语义和时间指导从关键帧和文本传递到每个中间帧。我们还通过重缩放时间RoPE来更好地实现帧的一致性,该方法允许自注意力更忠实地注意关键帧。TGI-Bench是第一个专为文本条件GI评估设计的基准, enables challenge-targeted evaluation to analyze GI models. 在无需额外训练的情况下,我们的方法在各种挑战下实现了最高的帧一致性、语义忠实度和节奏稳定性,适用于短序列和长序列。

关键词

引用

@article{arxiv.2603.17651,
  title  = {Anchoring and Rescaling Attention for Semantically Coherent Inbetweening},
  author = {Tae Eun Choi and Sumin Shim and Junhyeok Kim and Seong Jae Hwang},
  journal= {arXiv preprint arXiv:2603.17651},
  year   = {2026}
}

备注

Accepted to CVPR 2026; Code is released at https://github.com/teunchoi/TGI