基于跨模态融合注意力与自监督多事件表征学习的事件相机人脸关键点对齐
计算机视觉与模式识别
2026-03-31 v2
摘要
事件相机由于具有高时间分辨率和对光照变化的鲁棒性,在低光照和快速运动等挑战条件下进行人脸关键点对齐具有独特优势。然而,现有的 RGB 人脸关键点对齐方法在事件数据上表现不佳,且仅在事件数据上进行训练通常由于空间信息有限而导致次优性能。此外,缺乏全面标注的事件数据集进一步阻碍了该领域的进展。为了解决这些问题,我们提出了一种基于跨模态融合注意力(CMFA)和自监督多事件表征学习(SSMER)的新颖框架,用于基于事件的人脸关键点对齐。我们的框架采用 CMFA 整合对应的 RGB 数据,引导模型从事件输入图像中提取鲁棒的人脸特征。同时,SSMER 能够从无标注事件数据中进行有效的特征学习,克服空间限制。在我们真实的 E-SIE 事件数据集和公开的 WFLW-V 基准的合成事件版本上的大量实验表明,我们的方法在多个评估指标上始终超越最先进的方法。
引用
@article{arxiv.2509.24968,
title = {Event-based Facial Keypoint Alignment via Cross-Modal Fusion Attention and Self-Supervised Multi-Event Representation Learning},
author = {Donghwa Kang and Junho Kim and Dongwoo Kang},
journal= {arXiv preprint arXiv:2509.24968},
year = {2026}
}
备注
14 pages, 10 figures