中文

无递归的递归:基于深度平衡模型的稳定视频关键点检测

计算机视觉与模式识别 2023-04-04 v1 机器学习

摘要

级联计算(即预测在多个阶段中递归地精炼)一直是关键点检测模型发展过程中持久的主题。在本工作中,我们展示了最近提出的深度平衡模型(DEQ)可以自然地适配于这种计算形式。我们的关键点 DEQ(LDEQ)在具有挑战性的 WFLW 人脸关键点数据集上达到了最先进的性能,以更少的参数和关于递归模块数量的 O(1)\mathcal{O}(1) 训练内存代价实现了 3.923.92 NME。此外,我们展示了 DEQ 特别适用于视频中的关键点检测。在此场景下,由于缺乏标注视频,通常仅在静态图像上训练。这可能在视频推理时导致“闪烁”效应,即模型会在连续帧间不同合理解之间快速振荡。通过将 DEQ 重新表述为约束优化,我们在推理时模拟了递归,尽管训练时无法获取时序数据。这种“无递归的递归”(RwR)范式有助于减少关键点闪烁,我们通过引入一个新指标——归一化平均闪烁(NMF),并贡献一个针对关键点不确定性的新人脸关键点视频数据集(WFLW-V)来证明这一点。在由 500500 个视频组成的 WFLW-V 困难子集上,我们的带 RwR 的 LDEQ 相较于使用手工调节常规滤波器的最强已发表模型,分别将 NME 和 NMF 改善了 101013%13\%

关键词

引用

@article{arxiv.2304.00600,
  title  = {Recurrence without Recurrence: Stable Video Landmark Detection with Deep Equilibrium Models},
  author = {Paul Micaelli and Arash Vahdat and Hongxu Yin and Jan Kautz and Pavlo Molchanov},
  journal= {arXiv preprint arXiv:2304.00600},
  year   = {2023}
}