中文

基于自监督眼动重构的情感编码

计算机视觉与模式识别 2026-01-22 v2 人工智能

摘要

情感表达与眼动之间的关系已为人所熟知,文献表明凝视模式是情感的可靠指示器。然而,大多数研究依赖专业且高分辨率的眼动追踪设备,限制了其应用范围。我们探讨了如何从自然场景下的低分辨率视频中利用眼动来预测情感表达的多模态标记。我们利用美国加州大学洛杉矶分校色彩史料档案馆(USC Shoah Foundation)Visual History Archive 中的视频访谈记录,访谈对象为讲述其在奥斯维较集中营经历的大屠杀幸存者。受预训练语言模型方法的启发,我们开发了一种新型凝视检测模型,该模型利用自监督眼动重构能够有效地从无标签视频中获取信息。我们使用该模型的编码器嵌入来微调两个与情感表达相关的下游任务。第一个任务是将眼动与来自语音的情感估计方向对齐。第二个任务是将眼动用作预测三种瞬时情感行为的指示器:笑声、哭泣/抽泣和叹息。我们发现该新模型能够预测情感结果,并观察到预训练性能与情感处理性能之间存在正相关关系。我们得出结论,自监督眼动重构是一种有效的方法,能够编码其所携带的情感信号。

关键词

引用

@article{arxiv.2601.12534,
  title  = {Encoding Emotion Through Self-Supervised Eye Movement Reconstruction},
  author = {Marcus Ma and Jordan Prescott and Emily Zhou and Tiantian Feng and Kleanthis Avramidis and Gabor Mihaly Toth and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2601.12534},
  year   = {2026}
}