CLIP-AUTT:基于动作单元提示的面向细粒度视频情感识别测试时个人化
摘要
情感识别(ER)中的个人化对于准确解释细微且 subject-specific 的表达模式至关重要。近期诸如 CLIP 等视觉语言模型(VLMs)在 ER 中展示出强大的潜力,可利用联合图像-文本表示。然而,CLIP-based 方法要么依赖 CLIP 的对比预训练,要么依赖 LLM 生成描述性文本提示,这些提示噪声大、计算成本高,且无法捕获细粒度表达,导致性能下降。本文将动作单元(AUs)作为结构化文本提示纳入 CLIP,以建模细粒度面部表达。AUs 编码了表达背后的微小肌肉激活,为更稳健的 ER 提供局部且可解释的语义线索。我们引入 CLIP-AU,一种轻量级 AU 指导时序学习方法,将可解释的 AU 语义整合到 CLIP 中。它通过将 AU 提示与面部动力学对齐,学习通用、subject-agnostic 的表示,实现无需 CLIP 微调或 LLM 生成文本监督的细粒度 ER。虽然 CLIP-AU 模型细粒度 AU 语义,但无法适应细微表达中的 subject-specific 可变性。为此,我们提出 CLIP-AUTT,一种基于视频的测试时个人化方法,可动态地将 AU 提示适应到来自未知 subject 的视频。通过结合熵导师时序窗口选择和提示调谐,CLIP-AUTT 实现 subject-specific 适应,同时保持时序一致性。我们的大量实验表明,在 BioVid、StressID 和 BAH 等三个具有挑战性的基于视频的细微 ER 数据集上,CLIP-AU 和 CLIP-AUTT 均优于最先进的 CLIP-based FER 和 TTA 方法,实现稳健且个性化的细微 ER。我们的代码可在 https://github.com/osamazeeshan/CLIP-AUTT 上公开获取。
引用
@article{arxiv.2603.27999,
title = {CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition},
author = {Muhammad Osama Zeeshan and Masoumeh Sharafi and Benoît Savary and Alessandro Lameiras Koerich and Marco Pedersoli and Eric Granger},
journal= {arXiv preprint arXiv:2603.27999},
year = {2026}
}