中文

基于流形学习的有限数据下头部姿态估计方法NLML-HPE

计算机视觉与模式识别 2025-07-25 v1 机器学习

摘要

头部姿态估计(Head Pose Estimation, HPE)在人机交互和人脸识别等众多计算机视觉应用中发挥着关键作用。本文提出一种 novel 深度学习方法,通过非线性流 manifold learning 实现有限训练数据下的头部姿态估计,称为NLML-HPE。该方法基于张量分解(即Tucker分解)和前馈神经网络的结合。不同于传统基于分类的方法,本方法将头部姿态估计表述为回归问题,将输入 landmarks 映射到姿态角的连续表征。为此,本方法使用张量分解将每个欧拉角(yaw, pitch, roll)分解到独立子空间,并将每个维度的 underlying manifold 建模为余弦曲线。我们解决了两个关键挑战:1.几乎所有HPE数据集都存在错误和不准确的姿态标注。因此,我们通过旋转3D头部模型并渲染相应的2D图像,生成了一个精确且一致的2D头部姿态数据集用于训练。2.我们实现了有限训练数据下的实时性能,因为该方法准确捕捉了物体沿每个轴旋转的本质。一旦学习到每个轴旋转的 underlying manifold,模型在预测未见数据时速度极快。我们的训练和测试代码以及训练好的模型已在线发布:https://github.com/MahdiGhafoorian/NLML_HPE。

关键词

引用

@article{arxiv.2507.18429,
  title  = {NLML-HPE: Head Pose Estimation with Limited Data via Manifold Learning},
  author = {Mahdi Ghafourian and Federico M. Sukno},
  journal= {arXiv preprint arXiv:2507.18429},
  year   = {2025}
}