将位置编码重新思考为多参考多镜头视频生成的情境控制器
计算机视觉与模式识别
2026-04-07 v1
摘要
最新的专有模型如 Sora2 在生成以多个参考人物为条件的多镜头视频方面取得了显著进展。然而,学术界在这一问题上的研究仍有限。我们研究了这一任务,并识别出核心挑战:当参考图像显示高度相似的外观时,模型常常会出现参考混淆,即语义相似的 token 会损害模型检索正确情境的能力。为此,我们引入 PoCo (Position Embedding as a Context Controller),将位置编码作为语义检索之外的额外情境控制。通过利用 token 的侧信息,PoCo 实现了对 token 级别的精确匹配,同时保持隐式的语义一致性建模。基于 PoCo,我们开发了一个能够可靠地控制外观极其相似的角色的多参考多镜头视频生成模型。广泛的实验表明,PoCo 在 various baselines 上提高了跨镜头一致性和参考保真度。
引用
@article{arxiv.2604.03738,
title = {Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation},
author = {Binyuan Huang and Yuning Lu and Weinan Jia and Hualiang Wang and Mu Liu and Daiqing Yang},
journal= {arXiv preprint arXiv:2604.03738},
year = {2026}
}
备注
Accepted to CVPR 2026