中文

ViT 寄存器与分形 ViT

计算与语言 2026-01-23 v1 机器学习

摘要

受近期发现的启发,包括语言模型领域中无位置编码的 Transformer 出人意料地表现良好,以及寄存器(不与输入绑定的额外一次性 Token)如何能提升大型视觉 Transformer 的性能,我们发明并测试了一种名为分形 ViT 的 ViT 变体。该变体通过在常规 Token 和类似于寄存器的“摘要 Token”之间应用注意力掩码,单独或与各种位置编码结合使用,来打破 Token 之间的置换不变性。这些模型并未在带有寄存器的 ViT 基础上取得改进,突显了这些发现可能具有尺度、领域或应用特异性的这一事实。

关键词

引用

@article{arxiv.2601.15506,
  title  = {ViT Registers and Fractal ViT},
  author = {Jason Chuan-Chih Chou and Abhinav Kumar and Shivank Garg},
  journal= {arXiv preprint arXiv:2601.15506},
  year   = {2026}
}