中文

PoseGen:面向姿态可控长时段人类视频生成的上下文 LoRA 微调

计算机视觉与模式识别 2026-04-13 v2

摘要

生成具有时序一致性的长时段视频,同时精确控制主体身份和运动,仍是当下扩散模型面临的根本挑战,这些模型常因身份漂移且限制于短视频长度。我们提出 PoseGen,一种从单张参考图像和驱动视频生成延长时长人类视频的新框架。我们的贡献包括一种上下文 LoRA 微调设计,通过词元级别注入主体外观以实现身份保持,同时通过通道级别条件化姿态信息以实现细粒度运动控制。为克服时长限制,我们引入一种段交错生成策略,即先通过共享 KV-cache 机制生成具有改进背景一致性的非重叠片段,然后通过姿态感知插值生成将其拼接为连续序列。尽管仅在 33 小时视频数据集上训练,PoseGen 在身份保真性、姿态精确性和时序一致性方面均优于最先进的基线。代码可在 https://github.com/Jessie459/PoseGen 查看。

关键词

引用

@article{arxiv.2508.05091,
  title  = {PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation},
  author = {Jingxuan He and Busheng Su and Finn Wong},
  journal= {arXiv preprint arXiv:2508.05091},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings