OXSeg:基于多维注意力U-Net的半监督唇轮廓分割
计算机视觉与模式识别
2025-05-12 v1 图像与视频处理
摘要
唇部分割在唇同步、唇读和诊断等多种领域中扮演着关键角色。然而,监督唇部分割的有效性受到训练阶段唇轮廓可用性的制约。唇分割的另一个挑战在于其对图像质量、光照和肤色的依赖,导致检测边界不准确。为应对这些挑战,我们提出了一种将注意力U-Net与多维输入相结合的序贯唇分割方法。我们利用局部二值模式从面部图像中解构微观模式以构建多维输入。随后,多维输入被送入序贯注意力U-Net以重建唇轮廓。我们提出了一种利用少量解剖标志点估计完整唇轮廓的掩码生成方法以提升分割精度。该掩码在唇分割的训练阶段被使用。为评估所提方法,我们使用面部图像对上唇进行分割,并评估胎儿酒精综合征(FAS)受试者的唇部相关面部异常。使用所提唇分割方法,上唇分割获得了84.75%的平均Dice分数和99.77%的平均像素准确率。为进一步评估该方法,我们实现了分类器以识别FAS患者。使用生成对抗网络(GAN),在一个研究人群中达到了98.55%的FAS识别准确率。该方法可用于提升唇分割精度,特别是在唇弓(Cupid's bow)周围,并揭示FAS独特的唇部相关特征。
引用
@article{arxiv.2505.05531,
title = {OXSeg: Multidimensional attention UNet-based lip segmentation using semi-supervised lip contours},
author = {Hanie Moghaddasi and Christina Chambers and Sarah N. Mattson and Jeffrey R. Wozniak and Claire D. Coles and Raja Mukherjee and Michael Suttie},
journal= {arXiv preprint arXiv:2505.05531},
year = {2025}
}