中文

字节即所需:直接在文件字节上运行的 Transformer

计算机视觉与模式识别 2024-07-02 v2

摘要

现代深度学习方法通常使用特定模态的处理。例如,最常见的图像分类深度学习方法涉及将图像文件字节解码为传入神经网络的 RGB 张量。相反,我们通过直接在文件字节上执行分类、在推理时无需解码文件,来研究独立于模态的表示学习。这使得模型能够在无需任何手工设计的、特定模态处理的情况下处理多种模态。我们的模型 ByteFormer 在相似规模的 DeIT 模型基础上将 ImageNet Top-1 分类准确率相对提升了 5%5\%(从 72.2%72.2\%77.33%77.33\%)。与 Perceiver IO 相比,我们的模型在推理时完全不需要特定模态的处理,并且在 ImageNet 上达到同等准确率时使用的参数数量少一个数量级。我们证明相同的 ByteFormer 架构无需修改或特定模态的预处理即可执行音频分类。我们在 Speech Commands V2 数据集上达到了 95.42%95.42\% 的分类准确率(与 98.7%98.7\% 的当前最优准确率相当)。此外,我们证明 ByteFormer 可以联合处理图像和音频,在无需显式知晓输入模态的情况下进行联合分类。我们在 https://github.com/apple/corenet/tree/main/projects/byteformer 发布了代码。

关键词

引用

@article{arxiv.2306.00238,
  title  = {Bytes Are All You Need: Transformers Operating Directly On File Bytes},
  author = {Maxwell Horton and Sachin Mehta and Ali Farhadi and Mohammad Rastegari},
  journal= {arXiv preprint arXiv:2306.00238},
  year   = {2024}
}