Hardware Architecture · Computer Science
A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA
Neelesh Gupta, Peter Wang, Rajgopal Kannan, Viktor K. Prasanna
2026-03-09
Machine Learning · Computer Science
Lower Bounds for Chain-of-Thought Reasoning in Hard-Attention Transformers
Alireza Amiri, Xinting Huang, Mark Rofin, Michael Hahn
2025-07-15
Computation and Language · Computer Science
Learning Hard Retrieval Decoder Attention for Transformers
Hongfei Xu, Qiuhui Liu, Josef van Genabith, Deyi Xiong
2021-09-13
Machine Learning · Computer Science
Gated recurrent neural networks discover attention
Nicolas Zucchet, Seijin Kobayashi, Yassir Akram, Johannes von Oswald +3
2024-02-08
Computation and Language · Computer Science
A Systematic Analysis of Hybrid Linear Attention
Dustin Wang, Rui-Jie Zhu, Steven Abreu, Yong Shan +7
2025-07-10
Machine Learning · Computer Science
OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention
Chenyu Zhou, Hongpei Li, Yuerou Liu, Jianghao Lin +2
2026-05-14
Computation and Language · Computer Science
Keeping Notes: Conditional Natural Language Generation with a Scratchpad Mechanism
Ryan Y. Benmalek, Madian Khabsa, Suma Desu, Claire Cardie +1
2019-06-14
Computation and Language · Computer Science
QANet: Combining Local Convolution with Global Self-Attention for Reading Comprehension
Adams Wei Yu, David Dohan, Minh-Thang Luong, Rui Zhao +3
2018-04-26
Computation and Language · Computer Science
GTA: Grouped-head latenT Attention
Luoyang Sun, Cheng Deng, Jiwen Jiang, Xinjian Wu +4
2025-07-24
Hardware Architecture · Computer Science
Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers
Rya Sanovar, Srikant Bharadwaj, Renee St. Amant, Victor Rühle +1
2025-01-15
Computation and Language · Computer Science
Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
Yingfa Chen, Zhen Leng Thai, Zihan Zhou, Zhu Zhang +5
2026-01-30
Computation and Language · Computer Science
Simple linear attention language models balance the recall-throughput tradeoff
Simran Arora, Sabri Eyuboglu, Michael Zhang, Aman Timalsina +5
2025-03-10
Computation and Language · Computer Science
Recurrent Attention Networks for Long-text Modeling
Xianming Li, Zongxi Li, Xiaotian Luo, Haoran Xie +4
2023-06-13
Quantum Physics · Physics
A Hybrid Transformer Architecture with a Quantized Self-Attention Mechanism Applied to Molecular Generation
Anthony M. Smaldone, Yu Shee, Gregory W. Kyro, Marwa H. Farag +3
2025-08-05
Computation and Language · Computer Science
Retentive Network: A Successor to Transformer for Large Language Models
Yutao Sun, Li Dong, Shaohan Huang, Shuming Ma +4
2023-08-10
Machine Learning · Computer Science
Compositional Attention: Disentangling Search and Retrieval
Sarthak Mittal, Sharath Chandra Raparthy, Irina Rish, Yoshua Bengio +1
2022-02-15
Machine Learning · Computer Science
FG$^2$-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control
Pingwei Sun, Yuxuan Hu, Jianchao Tan, Xue Wang +5
2026-05-05