字符混合用于视频生成
计算机视觉与模式识别
2025-10-07 v1
摘要
想象一下,Bean 步入 Tom 和 Jerry 的世界,我们可以生成角色在不同世界之间自然交互的视频吗?我们研究了文本到视频生成中的跨角色交互,其中关键挑战是保持每个角色的身份和行为,同时实现连贯的跨情境交互。这很难,因为角色可能从未共存,并且混合样式常常导致样式幻觉,即真实角色看起来像卡通或反之。我们引入了一个框架,通过跨角色嵌入(CCE)学习身份和行为逻辑,以及跨角色增强(CCA)丰富训练数据,包括合成的共存和混合样式数据。通过这些技术,以前不存在的角色之间可以实现自然交互,而不会损失风格保真。在我们精选的由 10 个角色组成的动画和真人系列基准数据集上进行的实验显示,在身份保留、交互质量和对样式幻觉的鲁棒性方面均实现了明显的改进,开启了新的生成性叙事形式。附加结果和视频可在我们的项目页面上获取:https://tingtingliao.github.io/mimix/。
引用
@article{arxiv.2510.05093,
title = {Character Mixing for Video Generation},
author = {Tingting Liao and Chongjian Ge and Guangyi Liu and Hao Li and Yi Zhou},
journal= {arXiv preprint arXiv:2510.05093},
year = {2025}
}