Formal Languages and Automata Theory · Computer Science
Logical Languages Accepted by Transformer Encoders with Hard Attention
Pablo Barcelo, Alexander Kozachinskiy, Anthony Widjaja Lin, Vladimir Podolskii
2023-10-09
Formal Languages and Automata Theory · Computer Science
The Power of Hard Attention Transformers on Data Sequences: A Formal Language Theoretic Perspective
Pascal Bergsträßer, Chris Köcher, Anthony Widjaja Lin, Georg Zetzsche
2024-11-13
Computer Vision and Pattern Recognition · Computer Science
Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation
Israa A. Albadarneh, Bassam H. Hammo, Omar S. Al-Kadi
2025-06-09
Computation and Language · Computer Science
Incorporating Residual and Normalization Layers into Analysis of Masked Language Models
Goro Kobayashi, Tatsuki Kuribayashi, Sho Yokoi, Kentaro Inui
2021-09-16
Computer Vision and Pattern Recognition · Computer Science
A Hybrid Vision Transformer Approach for Mathematical Expression Recognition
Anh Duy Le, Van Linh Pham, Vinh Loi Ly, Nam Quan Nguyen +2
2026-03-10
Machine Learning · Computer Science
Unique Hard Attention: A Tale of Two Sides
Selim Jerad, Anej Svete, Jiaoda Li, Ryan Cotterell
2025-11-14
Machine Learning · Computer Science
A Provable Expressiveness Hierarchy in Hybrid Linear-Full Attention
Xiaowei Ye, Xiaoyu He, Chao Liao, Chen Wu +1
2026-02-03
Machine Learning · Computer Science
On the Existence of Universal Simulators of Attention
Debanjan Dutta, Anish Chakrabarty, Faizanuddin Ansari, Swagatam Das
2026-04-23
Computation and Language · Computer Science
Do Multilingual Neural Machine Translation Models Contain Language Pair Specific Attention Heads?
Zae Myung Kim, Laurent Besacier, Vassilina Nikoulina, Didier Schwab
2021-06-01
Computer Vision and Pattern Recognition · Computer Science
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
Zijie Song, Zhenzhen Hu, Yuanen Zhou, Ye Zhao +2
2024-04-08
Machine Learning · Computer Science
Simulating Hard Attention Using Soft Attention
Andy Yang, Lena Strobl, David Chiang, Dana Angluin
2025-06-27
Computer Vision and Pattern Recognition · Computer Science
Head Pursuit: Probing Attention Specialization in Multimodal Transformers
Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello +1
2026-01-15
Machine Learning · Computer Science
TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors
Ido Andrew Atad, Itamar Zimerman, Shahar Katz, Lior Wolf
2026-01-27
Computation and Language · Computer Science
An Attention Matrix for Every Decision: Faithfulness-based Arbitration Among Multiple Attention-Based Interpretations of Transformers in Text Classification
Nikolaos Mylonas, Ioannis Mollas, Grigorios Tsoumakas
2022-11-29
Logic in Computer Science · Computer Science
Cross-Attention and Encoder-Decoder Transformers: A Logical Characterization
Veeti Ahvonen, Damian Heiman, Antti Kuusisto, Miguel Moreno +1
2026-05-11
Computation and Language · Computer Science
An Exploration of Hierarchical Attention Transformers for Efficient Long Document Classification
Ilias Chalkidis, Xiang Dai, Manos Fergadiotis, Prodromos Malakasiotis +1
2022-10-12
Computation and Language · Computer Science
Universal Vector Neural Machine Translation With Effective Attention
Satish Mylapore, Ryan Quincy Paul, Joshua Yi, Robert D. Slater
2020-06-11
Computation and Language · Computer Science
Multi-Head Decoder for End-to-End Speech Recognition
Tomoki Hayashi, Shinji Watanabe, Tomoki Toda, Kazuya Takeda
2018-07-31
Machine Learning · Computer Science
On Difficulties of Attention Factorization through Shared Memory
Uladzislau Yorsh, Martin Holeňa, Ondřej Bojar, David Herel
2024-04-02