PolyVivid:基于跨模态交互与增强的多主体视频生成
计算机视觉与模式识别
2025-06-10 v1 人工智能
摘要
尽管近期在视频生成方面取得了进展,现有模型仍缺乏针对多主体定制的细粒度可控性,尤其在保持一致身份和交互方面存在不足。本文提出PolyVivid,一个多主体视频定制框架,实现灵活且身份一致的生成。为在主体图像和文本实体之间建立准确对应关系,我们设计了基于VLLM的文本-图像融合模块,将视觉身份嵌入文本空间以实现精确 grounding。为进一步增强身份保持和主体交互,我们提出了基于3D-RoPE的增强模块,实现文本和图像嵌入之间的结构化双向融合。此外,我们开发了一个基于MLLM的数据管道,结合MLLM-based grounding、分割和基于clique的主体整合策略,以产生高质量的多主体数据,有效提升主体区分度并降低下游视频生成中的歧义。大量实验表明,PolyVivid在身份忠实性、视频真实性和主体对齐方面表现优于现有开源和商业基线。
引用
@article{arxiv.2506.07848,
title = {PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement},
author = {Teng Hu and Zhentao Yu and Zhengguang Zhou and Jiangning Zhang and Yuan Zhou and Qinglin Lu and Ran Yi},
journal= {arXiv preprint arXiv:2506.07848},
year = {2025}
}