Focal-RegionFace:用于任意选取面部焦点区域的细粒度多属性描述生成
计算机视觉与模式识别
2026-01-05 v1
摘要
本文介绍了面部分析中的一个较少探讨的问题:为任意选取的面部区域(称为FaceFocalDesc),生成和识别包含面部动作单元(AUs)、情绪状态和年龄估计的多属性自然语言描述。我们认为,系统能够专注于 individual 面部区域的能力,有助于更好的理解和控制。为实现这一能力,我们构建了一个用于任意选取面部区域的多属性描述数据集,提供了丰富的区域级别注释和自然语言描述。进一步地,我们提出了一种基于Qwen2.5-VL的微调视觉语言模型,称为Focal-RegionFace,用于面部状态分析,通过多个逐步细化阶段来逐步细化对局部面部特征的关注,从而实现可解释的年龄估计、FAU和情感检测。实验结果表明,Focal-RegionFace在新基准测试中在传统和广泛使用的指标以及新提出的指标方面实现了最佳性能。这充分验证了其在面部区域聚焦分析场景中的有效性和通用性。
引用
@article{arxiv.2601.00156,
title = {Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions},
author = {Kaiwen Zheng and Junchen Fu and Songpei Xu and Yaoqing He and Joemon M. Jose and Han Hu and Xuri Ge},
journal= {arXiv preprint arXiv:2601.00156},
year = {2026}
}