ViT 寄存器与分形 ViT
计算与语言
2026-01-23 v1 机器学习
摘要
受近期发现的启发,包括语言模型领域中无位置编码的 Transformer 出人意料地表现良好,以及寄存器(不与输入绑定的额外一次性 Token)如何能提升大型视觉 Transformer 的性能,我们发明并测试了一种名为分形 ViT 的 ViT 变体。该变体通过在常规 Token 和类似于寄存器的“摘要 Token”之间应用注意力掩码,单独或与各种位置编码结合使用,来打破 Token 之间的置换不变性。这些模型并未在带有寄存器的 ViT 基础上取得改进,突显了这些发现可能具有尺度、领域或应用特异性的这一事实。
关键词
引用
@article{arxiv.2601.15506,
title = {ViT Registers and Fractal ViT},
author = {Jason Chuan-Chih Chou and Abhinav Kumar and Shivank Garg},
journal= {arXiv preprint arXiv:2601.15506},
year = {2026}
}