中文

STAP:一种用于无词汇表移动应用预测的超长上下文混洗标记预测器

机器学习 2026-05-29 v1

摘要

预测用户将要启动的下一个移动应用是智能设备资源管理和主动式辅助的关键任务。现有模型依赖固定的应用词汇表,无法在不同的应用生态系统之间泛化。许多模型还依赖于用户特定的知识,这使得在冷启动场景下的部署变得复杂。我们提出了STAP(Shuffle-Tokenized App Predictor),一种基于Transformer的模型,无需固定词汇表。STAP通过混洗机制将真实的应用身份替换为随机重新分配的虚拟索引,通过超长上下文设计来处理行为序列,以补偿被丢弃的语义信息。理论分析表明,在足够长的上下文给定情况下,尽管映射的匿名性,预测分布会收敛到正确的分布。在来自不同大洲的两个数据集上进行的实验表明,STAP实现了强大的跨数据集零样本预测准确率——这是所有现有固定词汇方法天然不可应用的设置——而其在每个数据集内的冷启动性能仍与领先模型相当。此外,我们引入了一种部署策略,使模型在连续推理期间能够保持足够长的上下文,同时将延迟控制在可接受范围内。

关键词

引用

@article{arxiv.2605.29863,
  title  = {STAP: A Shuffle-Tokenized App Predictor with Ultra Long Context for Vocabulary-Free Mobile App Prediction},
  author = {Chengyu Fan and Hang Liu},
  journal= {arXiv preprint arXiv:2605.29863},
  year   = {2026}
}

备注

15 pages, 9 figures, 5 tables Preprint submitted to Expert Systems with Applications