中文

FaVChat:基于数据高效 GRPO 的分层提示-查询引导面部视频理解

计算机视觉与模式识别 2026-05-12 v6

摘要

现有的视频大语言模型(VLLM)主要利用与提示无关的视觉编码器,这些编码器在不感知查询信息的情况下提取无目标的面部表示,导致任务关键线索的丢失。为了应对这一挑战,我们提出了 FaVChat,这是第一个专为对细微视觉和动态面部线索进行推理而设计的 VLLM。FaVChat 引入了一个分层的、提示引导的视觉特征提取框架,在三个互补层面上强调与问题相关的信息。这些多级特征被动态融合并注入到 LLM 中,从而实现更准确的面部细节推理。为了进一步提高数据稀缺下的学习效率,我们提出了 Data Efficient GRPO,这是一种强化学习策略,通过逐实例效用估计迭代识别高效用样本并最大化每个实例的贡献,从而在有限监督下显著提升性能增益。我们构建了一个大规模基准数据集 FaVChat 170K,包含约 60K 高质量面部视频和 170K 专注于细粒度面部细节的问答对。大量实验(包括在四个面部理解任务上的零样本评估)表明,FaVChat 始终优于现有的 VLLM。

关键词

引用

@article{arxiv.2503.09158,
  title  = {FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO},
  author = {Fufangchen Zhao and Songbai Tan and Xuerui Qiu and Linrui Xun and Wenhao Jiang and Jinkai Zheng and Hehe Fan and Jian Gao and Danfeng Yan and Ming Li},
  journal= {arXiv preprint arXiv:2503.09158},
  year   = {2026}
}