Vcc:通过优先重要 token 将 Transformer 扩展至 128K 或更多 token
计算与语言
2023-05-30 v2 机器学习
摘要
Transformer 是现代自然语言处理与计算机视觉应用的核心。尽管近期工作致力于降低此类模型随序列长度增长的二次方代价,处理超长序列(例如超过 16K token)仍具挑战性。诸如基于一本书回答问题或总结科学文章等应用效率低下或不可行。在此,我们提出通过在各层将序列压缩为小得多的表示,显著提升 Transformer 处理超长序列的效率。具体而言,利用许多任务中仅一小部分特殊 token(我们称为 VIP-token)与最终预测最相关这一事实,我们提出以 VIP-token 为中心的压缩(VCC)方案,依据其对近似 VIP-token 表示的影响有选择地压缩序列。相比具有竞争力的基线,我们的算法不仅高效(在 4K 与 16K 长度上相较基线取得超过 的效率增益),而且在大量任务上提供有竞争力或更优的性能。进一步,我们展示我们的算法可扩展至 128K token(或更多),同时持续提升精度。
引用
@article{arxiv.2305.04241,
title = {Vcc: Scaling Transformers to 128K Tokens or More by Prioritizing Important Tokens},
author = {Zhanpeng Zeng and Cole Hawkins and Mingyi Hong and Aston Zhang and Nikolaos Pappas and Vikas Singh and Shuai Zheng},
journal= {arXiv preprint arXiv:2305.04241},
year = {2023}
}
备注
10 pages main text, 12 pages appendix, preprint