PhysFormer:基于人脸视频的时序差分Transformer生理测量
计算机视觉与模式识别
2022-05-24 v2
摘要
远程光电容积描记(rPPG)旨在无需任何接触地从人脸视频中测量心脏活动与生理信号,在许多应用(如远程医疗与情感计算)中具有巨大潜力。近期的深度学习方法侧重于利用具有有限时空感受野的卷积神经网络挖掘细微rPPG线索,忽视了rPPG建模中长程时空感知与交互。本文中,我们提出PhysFormer,一种基于视频Transformer的端到端架构,以自适应聚合局部与全局时空特征来增强rPPG表征。作为PhysFormer的关键模块,时序差分Transformer首先以时序差分引导的全局注意力增强准周期rPPG特征,随后精炼局部时空表征以抗干扰。此外,我们还提出标签分布学习以及频域中受课程学习启发的动态约束,为PhysFormer提供精细监督并缓解过拟合。在四个基准数据集上进行了综合实验,以展示我们在数据集内与跨数据集测试上的优越性能。一个亮点是,与大多数需要从大规模数据集预训练的Transformer网络不同,所提出的PhysFormer可在rPPG数据集上从零轻松训练,这使其有望作为rPPG领域的新颖Transformer基线。代码将发布于https://github.com/ZitongYu/PhysFormer。
引用
@article{arxiv.2111.12082,
title = {PhysFormer: Facial Video-based Physiological Measurement with Temporal Difference Transformer},
author = {Zitong Yu and Yuming Shen and Jingang Shi and Hengshuang Zhao and Philip Torr and Guoying Zhao},
journal= {arXiv preprint arXiv:2111.12082},
year = {2022}
}
备注
Accepted by CVPR2022