核心令牌集:用于Transformer数据高效顺序训练
计算机视觉与模式识别
2024-10-10 v1 人工智能
摘要
深度网络经常针对新任务进行微调,并从持续的数据流中持续学习。这种顺序训练需要整合新旧信息,这一挑战主要通过保留最重要的数据点(正式称为核心集)来解决。传统上,这些核心集由整个样本组成,例如图像或句子。然而,最近的Transformer架构在令牌上运行,导致了著名的论断:一张图像相当于16x16个单词。直观地说,并非所有这些令牌都具有同等的信息量或可记忆性。因此,超越核心集,我们建议在令牌级别构建更深层次的数据摘要。我们分别命名的核心令牌集既选择信息量最大的数据点,又利用特征归因仅存储其最相关的特征。我们证明,核心令牌集在增量图像分类、开放式视觉问答和持续图像描述中,以显著减少的内存实现了显著的性能保持。事实上,我们通过实验发现,仅占数据1%的核心令牌集,其性能与至少大两倍、甚至大10倍的核心集相当。
引用
@article{arxiv.2410.05800,
title = {Core Tokensets for Data-efficient Sequential Training of Transformers},
author = {Subarnaduti Paul and Manuel Brack and Patrick Schramowski and Kristian Kersting and Martin Mundt},
journal= {arXiv preprint arXiv:2410.05800},
year = {2024}
}