ContextAnyone:面向字符一致文本到视频生成的上下文感知扩散模型
计算机视觉与模式识别
2025-12-09 v1 人工智能
摘要
文本到视频 (T2V) 生成技术取得了快速进展,但在保持跨场景中角色身份的一致性方面仍面临主要挑战。现有个性化方法通常仅关注面部身份,但未能保留更广泛的上下文线索,如发型、服装和身体形状,这些线索对于视觉连贯性至关重要。我们提出 ContextAnyone,一种基于上下文感知的扩散框架,实现从文本和单个参考图像生成保持角色一致性的视频。该方法联合重构参考图像并生成新的视频帧,使模型能够充分感知和利用参考信息。通过 novel Emphasize-Attention 模块将参考信息有效集成到基于 DiT 的扩散主干网络中,该模块选择性地强化参考感知特征并防止跨帧身份漂移。提出的双导向损失组合扩散和参考重构目标以增强外观保真度,同时提出的 Gap-RoPE 位置嵌入将参考 token 与视频 token 分离,以稳定时序建模。实验表明,ContextAnyone 在身份一致性和视觉质量方面优于现有的参考到视频方法,能够在多样化动作和场景下生成连贯且保持上下文的角色视频。项目页面:https://github.com/ziyang1106/ContextAnyone
引用
@article{arxiv.2512.07328,
title = {ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation},
author = {Ziyang Mai and Yu-Wing Tai},
journal= {arXiv preprint arXiv:2512.07328},
year = {2025}
}