基于Transformer的场景感知人体姿态生成
计算机视觉与模式识别
2023-08-07 v1
摘要
可供性学习考量场景中行为体的交互机会,因此在场景理解与智能机器人中有广泛应用。本文关注上下文可供性学习,即利用可供性作为上下文来生成场景中合理的人体姿态。现有场景感知人体姿态生成方法按是否使用姿态模板可分为两类。我们提出的方法属于基于模板的一类,受益于具代表性的姿态模板。此外,受近期基于Transformer的方法启发,我们将每个查询嵌入与一个姿态模板相关联,并利用查询嵌入与场景特征图之间的交互来有效预测各姿态模板的尺度与偏移量。另外,鉴于已预测的尺度,我们采用知识蒸馏来促进偏移量的学习。在Sitcom数据集上的充分实验证明了本方法的有效性。
引用
@article{arxiv.2308.02177,
title = {Scene-aware Human Pose Generation using Transformer},
author = {Jieteng Yao and Junjie Chen and Li Niu and Bin Sheng},
journal= {arXiv preprint arXiv:2308.02177},
year = {2023}
}
备注
Accepted by ACMMM 2023