Avey-B
计算与语言
2026-02-18 v1 人工智能
摘要
紧凑的预训练双向编码器仍是工业 NLP 中的核心,受限于计算和内存预算。其有效性源于自注意力能够以序列级并行方式提供高质量的双向上下文化,正如 BERT 风格架构所推广的那样。最近,Avey 被引入作为无注意力的自回归替代方案,自然地接受 encoder-only 适应。在本文中,我们为 encoder-only 范式重新构建 Avey,并提出了若干创新,包括解耦 static 和 dynamic 参数化、以稳定性为导向的归一化,以及神经压缩。结果显示,该重新构建的架构与四种广泛使用的基于 Transformer 的编码器相当,始终在标准 token 分类和信息检索基准测试中 outperform them while scaling more efficiently to long contexts。
引用
@article{arxiv.2602.15814,
title = {Avey-B},
author = {Devang Acharya and Mohammad Hammoud},
journal= {arXiv preprint arXiv:2602.15814},
year = {2026}
}