中文

Farzi Data:自回归数据蒸馏

机器学习 2023-10-17 v1 人工智能 计算与语言 信息检索

摘要

我们研究自回归机器学习任务中的数据蒸馏,其中输入与输出具有严格的从左到右因果结构。具体而言,我们提出 Farzi,它将事件序列数据集概括为少量合成序列——Farzi Data——这些序列经过优化,以在训练于完整数据集的模型性能基础上保持(甚至提升)模型表现。在内部实现上,Farzi 通过以下方式实现内存高效的数据蒸馏:(i) 利用 Hessian-Vector Products 推导 Adam 优化器的高效反向模式微分;(ii) 将高维离散事件空间分解为潜空间,该分解可证明地促进隐式正则化。在经验上,对于序列推荐与语言建模任务,当在最先进的模型上以仅原始数据集大小 0.1% 的 Farzi Data 进行训练时,我们能够达到下游全数据性能的 98–120%。值得注意的是,能够以显著更少的数据训练更好的模型,为未来大型自回归模型的设计提供了启示,并为进一步扩展模型与数据规模开辟了新机遇。

关键词

引用

@article{arxiv.2310.09983,
  title  = {Farzi Data: Autoregressive Data Distillation},
  author = {Noveen Sachdeva and Zexue He and Wang-Cheng Kang and Jianmo Ni and Derek Zhiyuan Cheng and Julian McAuley},
  journal= {arXiv preprint arXiv:2310.09983},
  year   = {2023}
}

备注

Under review. 23 pages, 9 figures