中文

DenseMarks:通过点轨迹学习人类头部图像的标准化嵌入

计算机视觉与模式识别 2026-04-21 v2

摘要

我们提出了 DenseMarks——一种用于人类头部图像的高质量稠密对应关系的新型学习表示。对于一张人类头部 2D 图像,Vision Transformer 网络会为每个像素预测一个 3D 嵌入,该嵌入对应于 3D 标准单位立方体中的位置。为训练我们的网络,我们收集了由 state-of-the-art 点跟踪器在多样化野生 talk heads 视频中估计的成对点匹配数据,并通过对比损失引导映射,鼓励匹配点具有接近的嵌入。我们进一步采用多任务学习中的面部关键点和分割约束,以及通过潜在立方特征施加嵌入空间连续性,这导致获得的表示具有可解释性和可查询性。该表示可用于寻找常见语义部分、面部/头部跟踪和立体重建。由于强监督,我们的方法对姿态变化具有鲁棒性,覆盖整个头部区域,包括头发。此外,标准化空间瓶颈确保获得的表示在不同姿态和个体之间是一致的。我们在几何感知点匹配和单目头部跟踪(使用 3D Morphable Models)方面实现了最前沿效果。代码和模型检查点将对公众开放。

关键词

引用

@article{arxiv.2511.02830,
  title  = {Densemarks: Learning Canonical Embeddings for Human Heads Images via Point Tracks},
  author = {Dmitrii Pozdeev and Alexey Artemov and Ananta R. Bhattarai and Artem Sevastopolsky},
  journal= {arXiv preprint arXiv:2511.02830},
  year   = {2026}
}

备注

ICLR 2026. Project page: https://diddone.github.io/densemarks/ .Video: https://youtu.be/o8DOOYFW0gI .21 pages, 13 figures, 2 tables