EmMixformer: 用于眼动识别的混合Transformer
计算机视觉与模式识别
2024-05-10 v2 密码学与安全
摘要
眼动(EM)是一种新的高安全性生物特征行为模态,近年来受到越来越多的关注。尽管深度神经网络(如卷积神经网络(CNN))最近取得了令人鼓舞的性能,但当前的解决方案未能捕捉眼动数据中的局部和全局时间依赖性。为了克服这个问题,我们在本文中提出了一种称为EmMixformer的混合Transformer,用于提取眼动识别的时间和频域信息。为此,我们提出了一个由三个模块组成的混合块:Transformer、注意力长短期记忆网络(attention LSTM)和傅里叶Transformer。我们是首次尝试利用Transformer学习眼动中的长时间依赖性。其次,我们将注意力机制引入LSTM,提出attention LSTM,旨在学习短时间依赖性。第三,我们在频域中执行自注意力以学习全局特征。由于这三个模块在局部和全局依赖性方面提供了互补的特征表示,所提出的EmMixformer能够提高识别准确率。在我们的眼动数据集和两个公开眼动数据集上的实验结果表明,所提出的EmMixformer通过实现最低的验证错误率,优于现有最先进方法。
引用
@article{arxiv.2401.04956,
title = {EmMixformer: Mix transformer for eye movement recognition},
author = {Huafeng Qin and Hongyu Zhu and Xin Jin and Qun Song and Mounim A. El-Yacoubi and Xinbo Gao},
journal= {arXiv preprint arXiv:2401.04956},
year = {2024}
}