人像解读及其基准数据集
计算机视觉与模式识别
2022-07-28 v1
摘要
我们提出了一项称为人像解读的任务,并为其构建了一个名为 Portrait250K 的数据集。当前关于人像的研究,如人体属性识别与行人重识别,已取得诸多成功,但普遍而言它们:1)可能缺乏对不同任务间相互关系及其可能带来收益的挖掘;2)为每个任务专门设计深度模型,效率低下;3)可能无法应对实际场景中对统一模型与综合感知的需求。本文提出的人像解读从一种新的系统化视角识别对人的感知。我们将人像感知划分为外观、姿态与情感三个方面,并为每一方面设计相应子任务。基于多任务学习框架,人像解读要求对人像的静态属性与动态状态进行综合描述。为激活该新任务的研究,我们构建了一个包含 25 万张图像的新数据集,标注了全身及手臂的身份、性别、年龄、体型、身高、表情与姿态。我们的数据集采集自 51 部电影,因此覆盖了广泛的多样性。此外,我们聚焦于人像解读的表征学习,并提出了一条反映我们系统化视角的基线方法。我们还针对该任务提出了恰当的评估指标。实验结果表明,组合人像解读相关任务可带来收益。代码与数据集将公开。
引用
@article{arxiv.2207.13315,
title = {Portrait Interpretation and a Benchmark},
author = {Yixuan Fan and Zhaopeng Dou and Yali Li and Shengjin Wang},
journal= {arXiv preprint arXiv:2207.13315},
year = {2022}
}