数据广度与深度对孪生神经网络模型性能的影响:基于三个击键动态数据集的实验
机器学习
2025-01-15 v1 计算机视觉与模式识别
机器学习
摘要
深度学习模型,如孪生神经网络(SNN),在捕获行为数据中的复杂模式方面显示出巨大潜力。然而,数据集广度(即受试者数量)和深度(例如,每个受试者的训练样本量)对这些模型性能的影响通常是非正式假设的,且仍有待深入探索。为此,我们使用“特征空间”和“密度”的概念进行了广泛的实验,以指导和深入理解数据集广度和深度对三个公开可用的击键数据集(Aalto、CMU 和 Clarkson II)的影响。通过改变训练受试者数量、每个受试者的样本数量、每个样本中的数据量以及训练中使用的三元组数量,我们发现,在可行的情况下,增加数据集广度能够训练出一个有效捕获更多受试者间变异性的训练良好的模型。相比之下,我们发现数据集深度的影响程度取决于数据集的性质。自由文本数据集受所有三个深度方向因素的影响:每个受试者的样本不足、序列长度、训练三元组和图库样本大小,这些都可能导致模型训练不足。固定文本数据集受这些因素的影响较小,因此更容易创建训练良好的模型。这些发现揭示了数据集广度和深度在训练用于行为生物识别的深度学习模型中的重要性,并为设计更有效的认证系统提供了有价值的见解。
引用
@article{arxiv.2501.07600,
title = {Impact of Data Breadth and Depth on Performance of Siamese Neural Network Model: Experiments with Three Keystroke Dynamic Datasets},
author = {Ahmed Anu Wahab and Daqing Hou and Nadia Cheng and Parker Huntley and Charles Devlen},
journal= {arXiv preprint arXiv:2501.07600},
year = {2025}
}
备注
19 pages, 4 figures