并非所有 Token 等同:基于 Token 聚类 Transformer 的人本视觉分析
计算机视觉与模式识别
2022-04-22 v3
摘要
视觉 Transformer 已在许多计算机视觉任务中取得巨大成功。多数方法通过将图像分割为规则固定网格并将每个单元视为一个 token 来生成视觉 token。然而,在人本视觉任务中并非所有区域同等重要,例如人体需要由许多 token 表示的精细表达,而图像背景可由少量 token 建模。为解决该问题,我们提出一种新颖的视觉 Transformer,称为 Token 聚类 Transformer(TCFormer),它通过渐进聚类合并 token,其中 token 可从不同位置以灵活形状和大小合并。TCFormer 中的 token 不仅能聚焦于重要区域,还能调整 token 形状以适配语义概念,并对包含关键细节的区域采用精细分辨率,有利于捕获详细信息。大量实验表明,TCFormer 在不同挑战性的人本任务和数据集上持续优于同类方法,包括 COCO-WholeBody 上的全身姿态估计和 3DPW 上的 3D 人体网格重建。代码见 https://github.com/zengwang430521/TCFormer.git
引用
@article{arxiv.2204.08680,
title = {Not All Tokens Are Equal: Human-centric Visual Analysis via Token Clustering Transformer},
author = {Wang Zeng and Sheng Jin and Wentao Liu and Chen Qian and Ping Luo and Wanli Ouyang and Xiaogang Wang},
journal= {arXiv preprint arXiv:2204.08680},
year = {2022}
}
备注
CVPR 2022 oral