中文

自监督远程生理测量的视觉-语言模型引导

计算机视觉与模式识别 2025-02-18 v2

摘要

面部视频-based 远程生理测量是检测人类生命体征(如心率、呼吸频率)的有前景的研究领域,可实现非接触式检测。传统方法大多为监督学习,需要大量面部视频和同步记录的 photoplethysmography(PPG)信号。为解决此问题,近期获得了自监督学习的关注;但由于缺乏真实 PPG 信号,其性能有限。本文提出一种新型自监督框架,成功地将流行的视觉-语言模型(VLM)集成到远程生理测量任务中。给定面部视频,我们首先通过变化 rPPG 信号频率增强其正负视频样本。随后,我们引入一种频率导向的视觉-文本配对生成方法,通过仔细创建正负样本的对比时空图并设计恰当的文本提示来描述其信号频率的相对比例。然后,采用预训练 VLM 提取这些形成的视觉-文本配对的特征,并据此估计 rPPG 信号。我们开发了一系列生成和对比学习机制来优化 VLM,包括文本引导的视觉图重建任务、视觉-文本对比学习任务以及频率对比和排序任务。总体而言,我们的方法首次将 VLM 应用于处理和对齐视觉和文本模态中与频率相关的知识。广泛的实验表明,在四个基准数据集上,该方法显著优于最先进的自监督方法。

关键词

引用

@article{arxiv.2407.08507,
  title  = {Bootstrapping Vision-language Models for Self-supervised Remote Physiological Measurement},
  author = {Zijie Yue and Miaojing Shi and Hanli Wang and Shuai Ding and Qijun Chen and Shanlin Yang},
  journal= {arXiv preprint arXiv:2407.08507},
  year   = {2025}
}

备注

International Journal of Computer Vision