中文

基于缓存个人化的测试时适应方法用于视频中的面部表情识别

计算机视觉与模式识别 2026-03-25 v2

摘要

视频中的面部表情识别(FER)需要模型个人化以捕捉不同主体间的显著变化。视觉语言模型(VLM)通过图像-文本对齐提供强大的下游任务迁移,但在主体分布迁移下性能仍可能下降。使用测试时适应(TTA)方法进行个人化可以缓解这一挑战。然而,大多数最先进的TTA方法依赖无监督参数优化,引入不实际的计算开销。本文引入通过缓存个人化实现的测试时适应(TTA-CaP),这是一种基于缓存的TTA方法,可实现面向视频FER的低成本(无梯度)个人化。先前的基于缓存的TTA方法仅依赖动态记忆存储测试样本,可能因噪声伪标签而积累误差并发生漂移。TTA-CaP利用三个协调的缓存:存储源域原型的个人化源缓存、累积可靠主体特定样本的正目标缓存、以及存储低置信度案例的负目标缓存以减少噪声伪标签的影响。缓存的更新和替换通过基于时间稳定性、置信度和与个人化缓存一致性的三门机制控制。最后,TTA-CaP通过融合嵌入生成精炼表示,支持支持时间上稳定的视频级别预测。我们在三个具有挑战性的视频FER数据集BioVid、StressID和BAH上的实验表明,TTA-CaP在主体特定和环境迁移下能够超过最先进的TTA方法,同时维持低计算和内存开销以实现实际部署。

关键词

引用

@article{arxiv.2603.21309,
  title  = {Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos},
  author = {Masoumeh Sharafi and Muhammad Osama Zeeshan and Soufiane Belharbi and Alessandro Lameiras Koerich and Marco Pedersoli and Eric Granger},
  journal= {arXiv preprint arXiv:2603.21309},
  year   = {2026}
}