中文

AnyTalker:基于交互式细化的多人说话视频生成扩放

计算机视觉与模式识别 2025-12-01 v1

摘要

最近,多人视频生成开始受到关注。虽然已有少数初步工作探索了音频驱动的多人说话视频生成,但这些方法常面临高成本的多样化多人数据收集以及难以以连贯的交互方式驱动多个身份的挑战。为此,我们提出 AnyTalker,一个具有可扩展多流处理架构的多人生成框架。具体而言,我们在扩散 Transformer 的注意力模块中引入新颖的身份感知注意力机制,通过迭代处理身份-音频对,实现可任意扩展可驱动身份的数量。此外,训练多人生成模型需要大量多人数据。我们提出的训练管道仅依赖单人视频即可学习多人说话模式,并通过仅少量真实多人短片实现交互式细化。我们还贡献了一个用于评估生成多人视频自然性和交互性的针对性指标和数据集。广泛的实验表明,AnyTalker 在显著的唇部同步、视觉质量和自然交互方面表现出色,在数据成本与身份可扩展性之间取得了 favorable 的平衡。

关键词

引用

@article{arxiv.2511.23475,
  title  = {AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement},
  author = {Zhizhou Zhong and Yicheng Ji and Zhe Kong and Yiying Liu and Jiarui Wang and Jiasun Feng and Lupeng Liu and Xiangyi Wang and Yanjia Li and Yuqing She and Ying Qin and Huan Li and Shuiyang Mao and Wei Liu and Wenhan Luo},
  journal= {arXiv preprint arXiv:2511.23475},
  year   = {2025}
}

备注

Homepage: https://hkust-c4g.github.io/AnyTalker-homepage