中文

结合面部视频和生物信号用于驾驶中的压力估计

计算机视觉与模式识别 2026-05-05 v3

摘要

可靠的压力识别对于医疗监测和安全关键系统(包括真实世界驾驶)等应用至关重要。虽然压力通常通过生理信号(如面部周围出汗和心率)检测,但面部活动提供了补充线索,可无需额外设备从视频中捕获。我们提出了一种多模态压力估计框架,结合面部视频和生理信号,即使在生物信号获取困难时也能有效工作。面部行为通过稠密3D形状可塑模型表示,生成56维描述符,捕捉时间上的细微表情和头部姿态动态。为了研究压力如何调制面部运动,我们在与 established 生理标记一起进行了大量实验。基线与压力刺激阶段之间的配对假设检验显示,38个56个面部组件均表现出一致的、特定于阶段的压力反应,相当于生理标记。基于这些发现,我们引入了基于Transformer的时序建模框架,并评估了单模态、早期融合和跨模态注意力策略。3D派生的面部特征与生理信号的跨模态注意力融合显著优于生理信号alone,使AUROC从52.7%和准确率从51.0%提升至92.0%和86.7%。虽然我们在驾驶数据上进行了评估,但该框架和协议可能适用于其他压力估计场景。

关键词

引用

@article{arxiv.2601.04376,
  title  = {Combining Facial Videos and Biosignals for Stress Estimation During Driving},
  author = {Paraskevi Valergaki and Vassilis C. Nicodemou and Iason Oikonomidis and Antonis Argyros and Anastasios Roussos},
  journal= {arXiv preprint arXiv:2601.04376},
  year   = {2026}
}

备注

Accepted to ICPR 2026