面向人类中心视觉感知的尺度感知预训练:实现轻量化和通用性模型
计算机视觉与模式识别
2025-06-30 v2
摘要
人类中心视觉感知(HVP)近期因大规模自监督预训练(SSP)取得显著进展。然而,现有HVP模型在适应实际应用时面临局限,这些应用需要保持计算可持续成本以确保与边缘设备兼容的同时,获得通用的视觉模式以适应下游任务。这些限制主要源于两个方面:1)预训练目标仅聚焦于特定视觉模式,限制了所学模式在多样下游任务中的可泛化性;2)HVP模型往往具有过大的模型规模,难以适应实际应用。为此,我们引入尺度感知图像预训练(SAIP),一种新的SSP框架,用于为HVP预训练轻量级视觉模型以获取通用模式。具体而言,SAIP基于跨尺度一致性原理,包含三个学习目标:1)跨尺度匹配(CSM),从多尺度单人图像中对比学习图像级不变模式;2)跨尺度重建(CSR),从多尺度遮蔽单人图像中学习像素级一致的视觉结构;3)跨尺度搜索(CSS),从多尺度多人图像中学习捕获多样化模式的能力。这三个目标相互补充,使轻量级模型能够学习HVP下游任务所必需的多尺度通用模式。跨越12个HVP数据集的广泛实验表明,SAIP在9个人类中心视觉任务上展现出显著的泛化能力。此外,它在单人鉴别任务中实现了3%-13%的显著性能提升,在稠密预测任务中实现1%-11%的提升,在多人视觉理解任务中实现1%-6%的提升。
引用
@article{arxiv.2503.08201,
title = {Scale-Aware Pre-Training for Human-Centric Visual Perception: Enabling Lightweight and Generalizable Models},
author = {Xuanhan Wang and Huimin Deng and Lianli Gao and Jingkuan Song},
journal= {arXiv preprint arXiv:2503.08201},
year = {2025}
}