Computation and Language · Computer Science
Pay Attention to What You Need
Yifei Gao, Shaohong Chen, Lei Wang, Ruiting Dai +4
2025-02-25
Computation and Language · Computer Science
The Closeness of In-Context Learning and Weight Shifting for Softmax Regression
Shuai Li, Zhao Song, Yu Xia, Tong Yu +1
2023-04-27
Computation and Language · Computer Science
Learning When to Attend: Conditional Memory Access for Long-Context LLMs
Sakshi Choudhary, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez +3
2026-03-19
Computation and Language · Computer Science
Sliding Window Attention Training for Efficient Large Language Models
Zichuan Fu, Wentao Song, Yejing Wang, Xian Wu +6
2025-06-05
Computation and Language · Computer Science
Core Context Aware Transformers for Long Context Language Modeling
Yaofo Chen, Zeng You, Shuhai Zhang, Haokun Li +3
2025-08-05
Computation and Language · Computer Science
Identifying Semantic Induction Heads to Understand In-Context Learning
Jie Ren, Qipeng Guo, Hang Yan, Dongrui Liu +3
2024-07-26
Machine Learning · Computer Science
LT2: Linear-Time Looped Transformers
Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu +3
2026-05-26
Computation and Language · Computer Science
SWAA: Sliding Window Attention Adaptation for Efficient and Quality Preserving Long Context Processing
Yijiong Yu, Jiale Liu, Qingyun Wu, Huazheng Wang +1
2026-03-27
Computation and Language · Computer Science
Attention Lens: A Tool for Mechanistically Interpreting the Attention Head Information Retrieval Mechanism
Mansi Sakarvadia, Arham Khan, Aswathy Ajith, Daniel Grzenda +4
2023-10-26
Machine Learning · Computer Science
LoLCATs: On Low-Rank Linearizing of Large Language Models
Michael Zhang, Simran Arora, Rahul Chalamala, Alan Wu +4
2025-03-07
Computation and Language · Computer Science
Knowing When to Stop: Efficient Context Processing via Latent Sufficiency Signals
Roy Xie, Junlin Wang, Paul Rosu, Chunyuan Deng +3
2026-02-10
Computation and Language · Computer Science
Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models
Mert Yuksekgonul, Varun Chandrasekaran, Erik Jones, Suriya Gunasekar +4
2024-04-18
Machine Learning · Computer Science
On the Role of Attention in Prompt-tuning
Samet Oymak, Ankit Singh Rawat, Mahdi Soltanolkotabi, Christos Thrampoulidis
2023-06-07
Computation and Language · Computer Science
Why Softmax Attention Outperforms Linear Attention
Yichuan Deng, Zhao Song, Kaijun Yuan, Tianyi Zhou
2026-03-16
Machine Learning · Computer Science
Softmax Linear Attention: Reclaiming Global Competition
Mingwei Xu, Xuan Lin, Xinnan Guo, Wanqing Xu +1
2026-02-03
Machine Learning · Computer Science
Selective Attention: Enhancing Transformer through Principled Context Control
Xuechen Zhang, Xiangyu Chang, Mingchen Li, Amit Roy-Chowdhury +2
2024-11-21
Computation and Language · Computer Science
Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps
Yung-Sung Chuang, Linlu Qiu, Cheng-Yu Hsieh, Ranjay Krishna +2
2024-10-04
Computation and Language · Computer Science
Gemma 2: Improving Open Language Models at a Practical Size
Gemma Team, Morgane Riviere, Shreya Pathak, Pier Giuseppe Sessa +194
2024-10-03
Machine Learning · Computer Science
Attention Needs to Focus: A Unified Perspective on Attention Allocation
Zichuan Fu, Wentao Song, Guojing Li, Yejing Wang +5
2026-01-08
Computation and Language · Computer Science
Efficient Attention Mechanisms for Large Language Models: A Survey
Yutao Sun, Zhenyu Li, Yike Zhang, Tengyu Pan +3
2026-02-10
Hardware Architecture · Computer Science
Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers
Rya Sanovar, Srikant Bharadwaj, Renee St. Amant, Victor Rühle +1
2025-01-15