面容表情识别基石模型中的代理偏置
计算机视觉与模式识别
2025-12-01 v1 人工智能
人机交互
摘要
基石模型 (Foundation Models, FMs) 正快速变革情感计算 (Affective Computing, AC) 领域,视觉-语言模型 (Vision Language Models, VLMs) 现在能够在零样本设置中识别情绪。本文探讨了一个关键但未被充分关注的问题:这些模型依赖哪些视觉线索来推断情感,这些线索是心理学上有依据的,还是仅仅是浅层学习的结果?我们对不同规模的 VLMs 在 AffectNet 数据集上进行基准测试,发现模型性能在可见牙齿存在时会发生一致的变化。通过对最佳表现模型(即 GPT-4o)进行结构化内省,我们发现面部属性如眉毛位置在其情感推理中发挥重要作用,揭示了其在价值- arousal 预测中高度的内在一致性。这些模式揭示了 FMs 行为的涌现性,但也揭示了风险:shortcut learning(捷径学习)、偏见和公平性问题,尤其是在像精神健康和教育等敏感领域。
引用
@article{arxiv.2506.19079,
title = {Reading Smiles: Proxy Bias in Foundation Models for Facial Emotion Recognition},
author = {Iosif Tsangko and Andreas Triantafyllopoulos and Adem Abdelmoula and Adria Mallol-Ragolta and Bjoern W. Schuller},
journal= {arXiv preprint arXiv:2506.19079},
year = {2025}
}