中文

基于帧间特征差分的微表情感知头像指纹

信号处理 2026-04-28 v1

摘要

头像指纹,即验证是谁驱动合成说话头视频而非视频本身真实性, 是面向面部重写技术授权使用的关键安全措施。现有方法依赖固定且不可微的地标提取阶段,阻止了从原始像素端到端地优化指纹模型。我们提出了一种无需预处理的系统,基于微表情感知的主干网络处理原始视频帧,以帧间特征差分作为核心设计原则:对连续的特征图在学习的深度特征空间中进行相减,使得时序稳定的外观维度贡献为零输出,而保留驱动者特定的运动动力学。在 NVFAIR 数据集上进行的受控消融实验确认,时序运动占据了判别性能的绝大多数比重,原始外观特征会主动降低身份分离效果。主干网络的选择与差分原则至关重要:仅应用差分到通用编码器上,因外观主导特征在相邻帧间几乎趋于相同,无法有效利用;而微表情感知的 F5C 主干网络保留了可被差分操作利用的可测量运动变化。本模型无需任何外部预处理,在 NVFAIR 数据集上实现了 0.877 的整体 AUC, 并在大多数跨生成器对中匹配或超越基于地标的基线方法。

关键词

引用

@article{arxiv.2604.23246,
  title  = {Leaky-Coaxial Pinching-Antenna System with Adjustable Slot Apertures},
  author = {Kaidi Wang and Daniel K. C. So and Zhiguo Ding and George K. Karagiannidis},
  journal= {arXiv preprint arXiv:2604.23246},
  year   = {2026}
}