迈向车载多任务人脸属性识别:探究合成数据与视觉基础模型
计算机视觉与模式识别
2024-03-12 v1 人工智能
机器学习
图像与视频处理
摘要
在蓬勃发展的智能交通系统领域,通过面部属性识别(如面部表情、眼睛注视、年龄等)增强车-驾驶员交互,对于安全性、个性化和整体用户体验至关重要。然而,缺乏全面的大规模真实世界数据集对训练鲁棒的多任务模型构成了重大挑战。现有文献通常忽略了合成数据集的潜力以及现有最优视觉基础模型在此类受限环境下的比较效能。本文通过研究合成数据集在训练识别车辆乘客面部属性(如注视平面、年龄和面部表情)的复杂多任务模型中的效用,填补了这些空白。利用预训练的Vision Transformer(ViT)和Residual Network(ResNet)模型的迁移学习技术,我们探索了各种训练和适应方法以优化性能,特别是在数据可用性有限的情况下。我们提供了广泛的评估后分析,研究了合成数据分布对模型在分布内数据和分布外推理中性能的影响。我们的研究揭示了反直觉的发现,特别是在我们的特定多任务语境下,ResNet的性能优于ViT,这归因于模型复杂度与任务复杂度的不匹配。我们的结果突出了在实际应用中增强合成数据和视觉基础模型使用的挑战与机遇。
引用
@article{arxiv.2403.06088,
title = {Towards In-Vehicle Multi-Task Facial Attribute Recognition: Investigating Synthetic Data and Vision Foundation Models},
author = {Esmaeil Seraj and Walter Talamonti},
journal= {arXiv preprint arXiv:2403.06088},
year = {2024}
}
备注
Manuscript under peer review