面向数据增强的受控面部操控与合成
计算机视觉与模式识别
2026-02-24 v1 机器学习
摘要
深度学习视觉模型在充足的监督下表现出色,但许多应用面临标签稀缺和类别不平衡的问题。受控图像编辑可用于增广稀缺的标注数据,然而编辑往往会引入伪影并使非目标属性发生 entanglement。我们在面部表情分析领域进行研究,针对 Action Unit(AU)操控进行建模,该任务因标注成本高且 AU 共激活导致属性 entanglement 而尤为关键。我们提出一种面部操控方法, operates in the semantic latent space of a pre-trained face generator(扩散自动编码器)。通过轻量级线性模型,我们采用(i)考虑 AU 共激活的依赖感知条件化,以及(ii)消除杂质属性方向(如眼镜)的正交投影,配合表情中和步骤,以实现绝对 AU 编辑。我们利用这些编辑平衡 AU 的发生情况,通过编辑标注人脸来实现 AU 分布的平衡,或通过受控合成多样化身份/人口学特征。将生成数据用于 AU 检测器训练可提升准确率,并产生更少的共激活捷径,从而实现更具解耦性的预测,性能优于替代的数据高效训练策略。在我们的学习曲线分析中,结果表明该方法在需要大量标注数据时可获得类似的改进效果。与现有方法相比,我们的编辑更有力,产生的伪影更少,身份保持更好。
引用
@article{arxiv.2602.19219,
title = {Controlled Face Manipulation and Synthesis for Data Augmentation},
author = {Joris Kirchner and Amogh Gudi and Marian Bittner and Chirag Raman},
journal= {arXiv preprint arXiv:2602.19219},
year = {2026}
}