中文

视线数据的数据标记化

机器学习 2025-03-31 v1 计算与语言 计算机视觉与模式识别 人机交互

摘要

今天大型语言模型(LLM)和多模态大型语言模型(MLLM)的性能在很大程度上取决于其数据标记化策略。虽然为文本和视觉输入开发的标记化器得到了广泛研究,但由于视线数据的特性,尚无针对视线数据的数据标记化策略的研究。然而,相应的数据标记化策略将允许通过微调利用预训练 MLLM 的视觉能力。本文旨在通过分析三组不同数据集上五种不同标记化器的表现,来弥合这一研究空白,以实现对视线数据的预测和生成。我们评估了标记化器在重构和压缩方面的能力。进一步地,我们为每种标记化策略训练一个 LLM,测量其生成和预测性能。总体而言,我们发现分位数标记化器在预测视线位置时性能最佳,而 k 均值聚类在预测视线速度时效果最佳。

关键词

引用

@article{arxiv.2503.22145,
  title  = {Tokenization of Gaze Data},
  author = {Tim Rolff and Jurik Karimian and Niklas Hypki and Susanne Schmidt and Markus Lappe and Frank Steinicke},
  journal= {arXiv preprint arXiv:2503.22145},
  year   = {2025}
}