中文

基于潜在表示的视频生理信号编辑

计算机视觉与模式识别 2026-04-07 v3 人机交互 多媒体

摘要

基于摄像头的生理信号估计提供了一种非接触且便捷的方式来监测心率 (HR)。然而,面部视频中包含的生命信号引发了重大的隐私担忧,因为它们可能揭示与个人健康和情绪状态相关的敏感信息。为此,我们提出一种学习框架,在保持视觉保真度的同时编辑视频中的生理信号。首先,我们通过预训练的 3D 变分自编码器 (3D VAE) 将输入视频编码到潜在空间,同时通过冻结文本编码器嵌入目标 HR 提示。我们使用带有自适应层归一化 (AdaLN) 的可训练时空层对其进行融合,以捕捉远程光电多普勒测量 (rPPG) 信号的强时序一致性。在解码器中应用特征线性调制 (FiLM),并通过微调的输出层以避免生理信号在重构期间的退化,实现对重构视频中生理信号的精确调制。实验结果表明,我们的方法在所选数据集上保持视觉质量,平均 PSNR 为 38.96 dB,SSIM 为 0.98;同时使用最先进的 rPPG 估计器实现平均 HR 调制误差为 10.00 bpm MAE 和 10.09% MAPE。我们的设计在可控 HR 编辑方面对于实用场景具有意义,如实时视频中对生物识别信号进行匿名化处理或合成具有所需生命体征的真实视频。

关键词

引用

@article{arxiv.2509.25348,
  title  = {Editing Physiological Signals in Videos Using Latent Representations},
  author = {Tianwen Zhou and Akshay Paruchuri and Josef Spjut and Kaan Akşit},
  journal= {arXiv preprint arXiv:2509.25348},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Subtle Visual Computing Workshop, 13 pages, 8 figures, 7 tables