中文

AUHead:通过动作单位控制实现真实情感说话人生成

计算机视觉与模式识别 2026-05-12 v2

摘要

真实的说话人视频生成对虚拟形象、电影制作和交互系统至关重要。当前方法因缺乏细粒度情感控制而难以处理细微情感表达。为此,我们提出一种新型两阶段方法(AUHead),以将细粒度情感控制,即动作单位(AUs),从音频中解耦,并实现可控生成。在第一阶段,我们通过空间时间 AUs 标记化和“情感-然后-AU”链式思考机制,探索大型音频语言模型(ALMs)的 AUs 生成能力,旨在从原始语音中有效捕捉细微情感线索。在第二阶段,我们提出一种 AU 驱动的可控扩散模型,其条件于 AU 序列合成真实的说话人视频。具体而言,我们首先将 AU 序列映射到结构化二维面部表征,以增强空间保真度,然后在交叉注意力模块中建模 AU-视觉相互作用。为实现灵活的 AU-质量权衡控制,我们在推理过程中引入 AU 解耦引导策略,进一步细化生成视频的情感表达和身份一致性。基准数据集上的结果表明,我们的方法在情感真实性、精确的唇同步和视觉连贯性方面实现了具竞争力的性能,显著优于现有技术。我们的实现已在 https://github.com/laura990501/AUHead_ICLR 上提供。

关键词

引用

@article{arxiv.2602.09534,
  title  = {AUHead: Realistic Emotional Talking Head Generation via Action Units Control},
  author = {Jiayi Lyu and Leigang Qu and Wenjing Zhang and Hanyu Jiang and Kai Liu and Zhenglin Zhou and Xiaobo Xia and Jian Xue and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2602.09534},
  year   = {2026}
}

备注

https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)