中文

LPM 1.0:基于视频的角色表现模型

计算机视觉与模式识别 2026-04-16 v2 人工智能 多媒体

摘要

表现是通过视觉、声音和时间行为将意图、情感和人格等外化为角色活力的关键。从视频中学习此类表现是传统3D流程的有前景的替代方案。然而,现有视频模型在实现高度表达性、实时推理和长期身份稳定性方面存在困难,这种困难我们称为“表现三难”。对话是最为全面的表现场景,因为角色在保持身份稳定的同时,同时进行说话、倾听、反应和情绪表达。为此,我们提出LPM 1.0(Large Performance Model),聚焦于单人全双工音视频对话表现。具体而言,我们通过严格筛选、说话-倾听音视频配对、表现理解和身份感知的多参考提取,构建了一个以人为中心的多模态数据集;训练一个170亿参数的扩散变压器(Base LPM),实现高度可控且身份一致的表现;并蒸馏为一个因果流式生成器(Online LPM),实现低延迟、无限长度交互。在推理时,给定带有身份感知参考的角色图像,LPM 1.0 可从用户音频生成倾听视频,从合成音频生成说话视频,并通过文本提示控制动作,所有操作均以实时速度进行,实现身份稳定、无限长度生成。因此,LPM 1.0 作为对话智能体、直播角色和游戏中的非玩家角色(NPC)的视觉引擎。为系统评估此场景,我们提出LPM-Bench,首个针对交互式角色表现的基准测试。LPM 1.0 在所有评估维度上均实现了最先进的成绩,同时保持实时推理。

关键词

引用

@article{arxiv.2604.07823,
  title  = {LPM 1.0: Video-based Character Performance Model},
  author = {Ailing Zeng and Casper Yang and Chauncey Ge and Eddie Zhang and Garvey Xu and Gavin Lin and Gilbert Gu and Jeremy Pi and Leo Li and Mingyi Shi and Shawn Wang and Sheng Bi and Steven Tang and Thorn Hang and Tobey Guo and Vincent Li and Xin Tong and Yikang Li and Yuchen Sun and Yue Zhao and Yuhan Lu and Yuwei Li and Zane Zhang and Zeshi Yang and Zi Ye},
  journal= {arXiv preprint arXiv:2604.07823},
  year   = {2026}
}

备注

43 pages, 15 figures, 2 tables. Project page: https://large-performance-model.github.io