中文

Kathleen:基于振荡器的字节级文本分类,无需分词或注意力机制

计算与语言 2026-05-14 v2

摘要

我们提出 Kathleen,这是一种直接在原始 UTF-8 字节上进行频域处理的文本分类架构,无需分词器、注意力机制,参数不足 47 万。Kathleen 引入若干新组件:(1) RecurrentOscillatorBanks — 带时间记忆的阻尼正弦卷积,实现 O(L) 序列处理;(2) FFT-Rotate Wavetable 编码器,使用单个可学习向量(256 个浮点数)映射所有 256 个字节值;(3) PhaseHarmonics — 仅 6 个可学习相位参数的正弦非线性(+2.6% 准确率,<0.001% 参数占比);(4) Content-Dependent Reverb with Positional Decay Modulation — 基于输入内容和已学习的位置索引偏置向量的衰减率调制的时序记忆机制;(5) Token-Level Module Sequencer,包含共振与不共振干扰通道。通过从初始 73 万参数基线(Kathleen-Clean)到当前 Kathleen-V9(46.9 万参数)的迭代架构演化,我们展示了可完全消除预训练同时提升准确率。Kathleen-V9 在 IMDB 上达到 88.5% ± 0.2%,在 AG News 上达到 92.4% ± 0.2%,在 SST-2 上达到 85.8% ± 0.5%(3 次随机种子平均值),在所有基准测试中与预训练基线持平或更好,参数减少 36%。在 SST-2 上,准确率提升了 2.5 个绝对百分点。Kathleen 以 O(L) 时间和空间复杂度处理序列。

关键词

引用

@article{arxiv.2604.07969,
  title  = {Kathleen: Oscillator-Based Byte-Level Text Classification Without Tokenization or Attention},
  author = {George Fountzoulas},
  journal= {arXiv preprint arXiv:2604.07969},
  year   = {2026}
}

备注

15 pages, 10 tables. v2: Added V9 architecture with Positional Decay Modulation. Pretraining eliminated. SST-2 improved from 83.3% to 85.8%