从任务驱动的先验学习面部分析中的集成令牌
计算机视觉与模式识别
2025-12-10 v3
摘要
面部分析表现出任务特定的特征变化。虽然卷积神经网络(CNN)已实现空间信息的精细表征,但视觉转换器(ViT)已促进了在补丁级别上对语义信息的表征。尽管过去十年 Backbone 架构取得了进展,但从特征表征的角度看,组合高保真模型往往会带来计算成本。本文引入 KT-Adapter,这是一种用于学习知识令牌的新方法,使我们能够以计算效率的方式集成高保真特征表征。具体而言,我们提出一种健壮的先验统一学习方法,在自注意力机制中生成知识令牌,跨越预训练编码器共享相互信息。这种知识令牌方法在计算成本方面具有极高的效率。我们的结果显示,在面部分析方面实现了显著的性能提升,特征表征方面观察到统计学上的显著性提升。
关键词
引用
@article{arxiv.2507.01290,
title = {Learning an Ensemble Token from Task-driven Priors in Facial Analysis},
author = {Sunyong Seo and Semin Kim and Jongha Lee},
journal= {arXiv preprint arXiv:2507.01290},
year = {2025}
}
备注
10 pages, 7 figures, 7 tables