PAL-Net:用于3D人脸 landmarks定位的点级CNN与补丁注意力
摘要
对解剖 landmarks 对3D人脸扫描进行手动注释是一项耗时且依赖专业知识的任务,但仍是临床评估、形态学分析和头面面部研究中的关键环节。虽然已提出多种深度学习方法用于人脸landmarks定位,但大多数方法聚焦于伪landmarks,或需要复杂的输入表示,限制了其临床适用性。本研究提出了完全自动化的深度学习管道(PAL-Net),用于在立体测量人脸模型上定位50个解剖landmarks。该方法结合了粗对齐、区域感兴趣过滤和landmarks的初始近似值,以及采用注意力机制增强的基于补丁的点级CNN。该方法在214个标注了健康成年人的扫描上进行了训练和评估,PAL-Net实现了3.686 mm的平均定位误差,保持了2.822 mm的平均解剖距离误差,相当于观察者间的变异性。为评估泛化性,该模型进一步在FaceScape数据集的700名受试者身上进行了评估,实现了0.41 mm的点级误差和0.38 mm的距离级误差。与现有方法相比,PAL-Net在准确率和计算成本之间实现了有利的权衡。虽然在网格质量较差的区域(如耳朵、发线)性能会下降,但该方法在大多数解剖区域表现出一致的准确性。PAL-Net能够有效地跨数据集和面部区域进行泛化,在点级和结构评估中均优于现有方法。它提供了一个轻量、可扩展的高通量3D人体测量分析解决方案,具有潜在的支持临床工作流程和减少对手动标注的依赖之势。源代码可在https://github.com/Ali5hadman/PAL-Net-A-Point-Wise-CNN-with-Patch-Attention 查找。
引用
@article{arxiv.2510.00910,
title = {PAL-Net: A Point-Wise CNN with Patch-Attention for 3D Facial Landmark Localization},
author = {Ali Shadman Yazdi and Annalisa Cappella and Benedetta Baldini and Riccardo Solazzo and Gianluca Tartaglia and Chiarella Sforza and Giuseppe Baselli},
journal= {arXiv preprint arXiv:2510.00910},
year = {2026}
}
备注
Published in Informatics in Medicine Unlocked. Code available at: https://github.com/Ali5hadman/PAL-Net-A-Point-Wise-CNN-with-Patch-Attention