基于单向卷积的多任务视线估计
计算机视觉与模式识别
2024-12-10 v2
摘要
在视线估计任务中使用轻量级模型作为 backbone 网络常常导致显著的性能下降。其主要原因是轻量级网络的特征通道数通常较小,导致模型表达能力受限。为了提高轻量级模型在视线估计任务中的性能,提出了名为 Multitask-Gaze 的网络模型。Multitask-Gaze 的主要组件包括单向卷积(UC)、空间和通道注意力(SCA)、全局卷积模块(GCM)和多任务回归模块(MRM)。UC 不仅显著减少了参数数量和 FLOPs,还扩展了感受野,提高了模型对长距离建模的能力,从而提高了模型性能。SCA 突出显示与视线相关的特征并抑制与视线无关的特征。GCM 替代池化层,避免由于信息丢失导致的性能下降。MRM 改进了各个任务的准确性,并加强了任务之间的连接以提高整体性能。实验结果表明,与最新方法 SUGE 相比,Multitask-Gaze 在 MPIIFaceGaze 和 Gaze360 数据集上的性能分别提高了 1.71% 和 2.75%,而参数数量和 FLOPs 分别显著降低了 75.5% 和 86.88%。
引用
@article{arxiv.2411.18061,
title = {Multi-task Gaze Estimation Via Unidirectional Convolution},
author = {Zhang Cheng and Yanxia Wang},
journal= {arXiv preprint arXiv:2411.18061},
year = {2024}
}