人体姿态描述与主体聚焦注意力用于提升以人为中心分类任务中的零样本迁移
计算机视觉与模式识别
2024-10-30 v3
摘要
我们提出了一种基于大语言模型(LLM)的新颖流程,仅利用辅助属性即可生成图像中人体姿态的上下文描述。该方法促进了 MPII Pose Descriptions 数据集的构建,该数据集包含对 17,367 张图像的自然语言标注,涵盖了人们从事的 410 种不同活动。我们展示了姿态描述在利用 CLIP 实现零样本以人为中心分类方面的有效性。此外,我们引入了 FocusCLIP 框架,该框架在 CLIP 中融入了主体聚焦注意力(Subject-Focused Attention, SFA),以改进文本到图像的对齐。我们的模型在 MPII Pose Descriptions 数据集上进行了预训练,并在涵盖三个任务的五个未见数据集上评估了其零样本性能。FocusCLIP 优于基线 CLIP 模型,平均准确率提高了 8.61%(33.65% 对比 CLIP 的 25.04%)。值得注意的是,我们的方法在活动识别、年龄分类和情绪识别方面分别取得了 3.98%、14.78% 和 7.06% 的提升。这些结果突显了将详细的姿态描述和主体级指导整合到通用预训练框架中,以增强下游任务性能的潜力。
引用
@article{arxiv.2403.06904,
title = {Human Pose Descriptions and Subject-Focused Attention for Improved Zero-Shot Transfer in Human-Centric Classification Tasks},
author = {Muhammad Saif Ullah Khan and Muhammad Ferjad Naeem and Federico Tombari and Luc Van Gool and Didier Stricker and Muhammad Zeshan Afzal},
journal= {arXiv preprint arXiv:2403.06904},
year = {2024}
}