无递归的递归:基于深度平衡模型的稳定视频关键点检测
计算机视觉与模式识别
2023-04-04 v1 机器学习
摘要
级联计算(即预测在多个阶段中递归地精炼)一直是关键点检测模型发展过程中持久的主题。在本工作中,我们展示了最近提出的深度平衡模型(DEQ)可以自然地适配于这种计算形式。我们的关键点 DEQ(LDEQ)在具有挑战性的 WFLW 人脸关键点数据集上达到了最先进的性能,以更少的参数和关于递归模块数量的 训练内存代价实现了 NME。此外,我们展示了 DEQ 特别适用于视频中的关键点检测。在此场景下,由于缺乏标注视频,通常仅在静态图像上训练。这可能在视频推理时导致“闪烁”效应,即模型会在连续帧间不同合理解之间快速振荡。通过将 DEQ 重新表述为约束优化,我们在推理时模拟了递归,尽管训练时无法获取时序数据。这种“无递归的递归”(RwR)范式有助于减少关键点闪烁,我们通过引入一个新指标——归一化平均闪烁(NMF),并贡献一个针对关键点不确定性的新人脸关键点视频数据集(WFLW-V)来证明这一点。在由 个视频组成的 WFLW-V 困难子集上,我们的带 RwR 的 LDEQ 相较于使用手工调节常规滤波器的最强已发表模型,分别将 NME 和 NMF 改善了 和 。
引用
@article{arxiv.2304.00600,
title = {Recurrence without Recurrence: Stable Video Landmark Detection with Deep Equilibrium Models},
author = {Paul Micaelli and Arash Vahdat and Hongxu Yin and Jan Kautz and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2304.00600},
year = {2023}
}