过细还是过粗?用于鲁棒左右眼动追踪分类器的数据复杂度黄金组合
信号处理
2022-09-09 v1 机器学习
摘要
基准数据与真实世界数据之间分布模式的差异,一直是使用脑电图 (EEG) 信号进行眼动追踪 (ET) 分类的主要挑战之一。因此,提升机器学习模型从 EEG 数据预测眼动追踪位置的鲁棒性,对于研究与消费应用都至关重要。此前,我们比较了仅在更细粒度数据上训练的 classifier 与仅在粗粒度数据上训练的 classifier 的性能。结果表明,尽管鲁棒性整体有所提升,但当测试集与训练集包含相同分布模式时,细粒度训练模型的性能较粗粒度训练模型下降 \cite{vectorbased}。本文旨在通过采用混合数据复杂度的数据集训练模型来确定细粒度与粗粒度数据的理想分布,以解决该情形。我们利用由细粒度与粗粒度数据共同组成的混合数据集训练机器学习模型,然后将准确率与仅使用细粒度或粗粒度数据训练的模型进行比较。就我们的目的而言,细粒度数据指以更复杂方法收集的数据,而粗粒度数据指以更简单方法收集的数据。我们施加协变量分布偏移以检验各训练集的敏感性。我们的结果表明,EEG-ET 分类的最优训练数据集并非仅由细粒度或粗粒度数据构成,而是偏向细粒度的两者混合。
引用
@article{arxiv.2209.03761,
title = {Too Fine or Too Coarse? The Goldilocks Composition of Data Complexity for Robust Left-Right Eye-Tracking Classifiers},
author = {Brian Xiang and Abdelrahman Abdelmonsef},
journal= {arXiv preprint arXiv:2209.03761},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2208.00465