中文

基于文本引导的动态面部表情识别弱监督框架

计算机视觉与模式识别 2025-11-17 v1 人工智能

摘要

动态面部表情识别(DFER)旨在通过建模面部运动在视频序列中的时间变化来识别情感状态。DFER 的关键挑战在于所谓的“一对多”标签问题,即由大量帧组成的视频被分配单个情绪标签。缓解此问题的常见策略是将 DFER 问题形式化为多实例学习(MIL)问题。然而,基于 MIL 的方法天然受情绪表情视觉多样性和时间动态复杂度的制约。为此,我们提出了 TG-DFER,一种基于文本引导的弱监督框架,通过融合语义指导和连贯的时间建模来增强基于 MIL 的 DFER。我们集成了基于视觉语言预训练(VLP)模型,通过情绪语境的细粒度文本描述提供语义指导。进一步,我们引入视觉提示,将丰富的文本情绪标签与视觉实例特征对齐,实现细粒度推理和帧级相关性估计。此外,设计了多层次时间网络,以联合捕获短期面部动力学和长程情绪流,确保跨时间的连贯情感理解。大量实验表明,在弱监督条件下,TG-DFER 实现了更好的泛化性、可解释性和时间敏感性。

关键词

引用

@article{arxiv.2511.10958,
  title  = {Text-guided Weakly Supervised Framework for Dynamic Facial Expression Recognition},
  author = {Gunho Jung and Heejo Kong and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2511.10958},
  year   = {2025}
}