中文

MoCha:面向电影级说话人物的合成

计算与语言 2025-04-01 v1

摘要

近期的视频生成技术在运动真实性方面取得了显著进展,但往往忽视了以人物为导向的叙事,这是自动化电影和动画生成的关键任务。我们提出了说话人物 (Talking Characters) 任务,即从语音和文本直接生成说话人物动画。与说话头部不同,说话人物旨在生成角色的完整肖像,超出面部区域。在本文中,我们提出了 MoCha,首个实现该任务的系统。为确保视频与语音之间的精确同步,我们提出了一种语音-视频窗口注意力机制,有效对齐语音和视频标记。为解决大规模带语音标注视频数据稀缺的难题,我们引入联合训练策略,利用语音标注和文本标注视频数据,显著提升了在多样化人物动作下的泛化能力。我们还设计了带有角色标签的结构化提示模板,首次实现多角色对话,支持基于轮次的对话,使 AI 生成的角色能够在电影化连贯性下进行情境感知对话。广泛的定性和定量评估,包括人类偏好研究和基准比较,表明 MoCha 为 AI 生成的电影叙事树立了新标准,实现了卓越的真实性、表达性、可控性和泛化能力。

关键词

引用

@article{arxiv.2503.23306,
  title  = {Focus Directions Make Your Language Models Pay More Attention to Relevant Contexts},
  author = {Youxiang Zhu and Ruochen Li and Danqing Wang and Daniel Haehn and Xiaohui Liang},
  journal= {arXiv preprint arXiv:2503.23306},
  year   = {2025}
}