中文

SyncLipMAE:面向音视频说话人面部表征的对比遮蔽预训练

人工智能 2026-01-07 v2 多媒体

摘要

我们提出SyncLipMAE,这是一种用于说话人面部视频的自监督预训练框架,能够从无标签的音视频流中学习同步感知且可迁移的面部动态。我们的 метод将遮蔽视觉建模与跨模态对齐结合,并采用三组逐帧提示标记,显式编码说话人面部帧的关键因素——身份、声带运动(与语音同步的面部动态)以及环境运动(如眨眼和头部姿态等无音频依赖的运动)。对比目标将时间对齐的声带运动和音频标记作为正样本,将错位的配对作为负样本,从而将两种模态驱动到共享的嵌入空间中,实现标记级别的音视频流同步。预训练后,对齐后的音频标记与视觉提示标记(身份、声带运动、环境运动)形成统一的接口,用于四种截然不同的下游任务:(i)音视频流同步;(ii)面部情绪和头部/面部动作识别;(iii)视觉语音识别;以及(iv)视觉配音,其中我们在单一模型中实现了无差别的音频或视频驱动控制。SyncLipMAE 在需要不同能力的四类任务中实现了最先进的结果,凸显了同步感知、因子化自监督预训练的有效性。

关键词

引用

@article{arxiv.2510.10069,
  title  = {SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation},
  author = {Zeyu Ling and Xiaodong Gu and Jiangnan Tang and Changqing Zou},
  journal= {arXiv preprint arXiv:2510.10069},
  year   = {2026}
}