Synthetic-Child:基于 AIGC 的隐私保护儿童姿态估计合成数据管线
摘要
准确的儿童姿态估计对于 AI 驱动的学习伴侣设备至关重要,但收集大规模带注释的儿童数据集既昂贵又不可行,因为涉及隐私问题。我们提出 Synthetic-Child,一个基于 AIGC 的合成数据管线,生成带有 ground-truth 投影关键点注释的逼真儿童姿态训练图像,无需任何真实儿童照片。该管线包含四个阶段:(1)在 Blender 中生成可编程的 3D 儿童身体模型(SMPL-X),产生受 IK 约束的解剖学合理性和自动 COCO 格式 ground-truth 导出的多样化写作业姿态;(2)自定义 PoseInjectorNode 将 3D 桼骨输入到基于 FLUX-1 Dev 的双 ControlNet(姿态 + 深度)条件下合成 12,000 张逼真图像,覆盖 10 个姿态类别,低注释漂移;(3)基于 ViTPose 的置信度过滤和针对性数据增强消除生成失效并提高鲁棒性;(4)在合成数据上微调 RTMPose-M(1360 万参数),配合几何特征工程和轻量 MLP 进行姿态分类,然后量化为 INT8 以实现边缘部署。在约 300 人的真实儿童测试集上,FP16 模型实现 71.2 AP——相较于 COCO 预训练的成人数据基线在相同模型容量下提升了 12.5 AP。INT8 量化后模型保持 70.4 AP,同时在 0.8 TOPS 的 Rockchip RK3568 NPU 上以 22 FPS 的速度运行。在与一款商业姿态矫正器的单主体控制比较中,我们的系统在大多数测试类别上实现显著更高的识别率,平均响应速度快约 1.8 倍。这些结果表明,精心设计的 AIGC 管线可大幅减少对真实儿童图像的依赖,同时实现部署就绪的精度,潜在可应用于其他隐私敏感领域。
引用
@article{arxiv.2603.02598,
title = {Synthetic-Child: An AIGC-Based Synthetic Data Pipeline for Privacy-Preserving Child Posture Estimation},
author = {Taowen Zeng},
journal= {arXiv preprint arXiv:2603.02598},
year = {2026}
}
备注
16 pages, 3 figures, 5 tables