FaceInsight: 面向面部感知的多模态大型语言模型
机器学习
2025-10-20 v2 系统与控制
系统与控制
摘要
近期多模态大型语言模型 (Multimodal Large Language Model, MLLM) 的进展显示出强大的理解一般视觉内容的能力。然而,这些通用领域的 MLLM 在面部感知任务中表现不佳,常常对面部特定查询产生不准确或误导性的响应。为弥合这一差距,我们提出了 FaceInsight,一个提供细粒度面部信息的通用面部感知 MLLM。我们的ethods 引入了面部知识的视觉-文本对齐,以建模面部信息中不确定的依赖关系和确定性关系,从而减轻语言驱动推理的局限性。此外,我们将面部分割图作为辅助感知模态纳入,其中包含局部结构线索以增强语义理解。针对三个面部感知任务进行的全面实验和分析表明,FaceInsight 在训练免费和微调设置下均 consistently 超过九个比较型 MLLM。
引用
@article{arxiv.2504.15623,
title = {RadioDiff-$k^2$: Helmholtz Equation Informed Generative Diffusion Model for Multi-Path Aware Radio Map Construction},
author = {Xiucheng Wang and Qiming Zhang and Nan Cheng and Ruijin Sun and Zan Li and Shuguang Cui and Xuemin Shen},
journal= {arXiv preprint arXiv:2504.15623},
year = {2025}
}