中文

从弱到强:基于 VLM 的伪标签策略在多模态视频隐藏情绪理解任务中的应用

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

为解决视频中“隐藏情绪”自动识别问题,本文提出一种多模态弱监督框架,并在 iMiGUE 网球采访数据集上取得最新进展。首先,YOLO 11x 按帧检测并裁剪人类肖像,DINOv2-Base 从裁剪区域提取视觉特征。随后,集成 Chain-of-Thought 与 Reflection 提示 (CoT + Reflection),Gemini 2.5 Pro 自动生成伪标签和推理文本作为下游模型的弱监督。随后,OpenPose 生成 137 维关键点序列,增添帧间偏移特征;通常的图神经网络主干简化为 MLP,以高效建模三个关键点流的时间空间关系。一个超长序列 Transformer 独立编码图像和关键点序列,其表示与 BERT 编码的采访稿本拼接。每个模态首先在孤立状态下预训练,然后联合微调,将伪标记样本合并到训练集中以获得进一步提升。实验表明,尽管面临严重类别不平衡,本方法将准确率从先前工作中的低于 0.6 提升至超过 0.69,建立了新的公共基准。本研究还验证了“简化”关键点主干可以在此任务中匹配甚至超越 GCN-based 方法。

关键词

引用

@article{arxiv.2602.08057,
  title  = {Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks},
  author = {Yufei Wang and Haixu Liu and Tianxiang Xu and Chuancheng Shi and Hongsheng Xing},
  journal= {arXiv preprint arXiv:2602.08057},
  year   = {2026}
}