中文

SocialDirector:用于多人视频生成的免训练社交交互控制

计算机视觉与模式识别 2026-05-12 v1

摘要

视频生成技术发展迅速,能够根据文本或图像提示生成逼真的视频。同时,电影制作和社交机器人越来越需要具有丰富社交互动(包括对话、手势和协调动作)的多人视频。然而,现有模型没有提供对交互的明确控制,例如谁执行哪个动作、何时发生以及指向谁。这通常导致错误的人执行非预期动作(执行者-动作不匹配)、社交动态混乱以及错误动作目标。为了应对这些挑战,我们提出了 SocialDirector,这是一种免训练的交互控制器,通过调制交叉注意力图来增强生成模型。SocialDirector 包含两个模块:社交执行者掩码和方向重加权。社交执行者掩码通过时空掩码将每个人的视觉标记限制为仅关注其自身的文本描述,从而避免执行者-动作不匹配和社交动态混乱。方向重加权放大了对方向词(例如,“向左”、“右”)的注意力,引导每个动作指向其预期目标。为了评估生成的社交交互,我们用交互描述对现有数据集进行了标注,并构建了一个由开源 VLM 驱动的全自动评估流水线。在不同视频生成模型上的实验表明,SocialDirector 显著提高了交互保真度,并逼近了真实视频设定的上限。

关键词

引用

@article{arxiv.2605.10079,
  title  = {SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation},
  author = {Liangyang Ouyang and Ruicong Liu and Caixin Kang and Yifei Huang and Yoichi Sato},
  journal= {arXiv preprint arXiv:2605.10079},
  year   = {2026}
}