中文

面向眼动估计的差分对比训练

机器学习 2025-02-28 v1 计算机视觉与模式识别

摘要

复杂的应用场景提升了对精确和通用性眼动估计方法的严格要求。最近,预训练的 CLIP 在各种视觉任务中取得了显著性能,但其潜力尚未在眼动估计中得到充分挖掘。本文提出一种新的差分对比训练策略,借助 CLIP 提升眼动估计性能。相应地,引入基于视觉外观感知分支和语义差分感知分支的差分对比眼动估计网络(DCGaze)。视觉外观感知分支本质上是一个主要的眼动估计网络,集成了自适应特征细化单元(AFU)和双头眼动回归器(DGR),两者均有助于主网络提取信息丰富且与眼动相关的外观特征。此外,语义差分感知分支基于 CLIP 的文本编码器设计,用于揭示眼动的语义差异。该分支能够进一步赋予视觉外观感知分支以刻画眼动相关语义信息的能力。在四个具有挑战性的数据集上进行的大量实验显示,我们的 DCGaze 在 within 和 cross-domain 任务中表现有效。代码已公开于 https://github.com/LinZhang-bjtu/DCGaze。

关键词

引用

@article{arxiv.2502.20126,
  title  = {FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less Compute},
  author = {Sotiris Anagnostidis and Gregor Bachmann and Yeongmin Kim and Jonas Kohler and Markos Georgopoulos and Artsiom Sanakoyeu and Yuming Du and Albert Pumarola and Ali Thabet and Edgar Schönfeld},
  journal= {arXiv preprint arXiv:2502.20126},
  year   = {2025}
}