Hardware Architecture · Computer Science
Indirection Stream Semantic Register Architecture for Efficient Sparse-Dense Linear Algebra
Paul Scheffler, Florian Zaruba, Fabian Schuiki, Torsten Hoefler +1
2020-12-15
Hardware Architecture · Computer Science
Sparse Stream Semantic Registers: A Lightweight ISA Extension Accelerating General Sparse Linear Algebra
Paul Scheffler, Florian Zaruba, Fabian Schuiki, Torsten Hoefler +1
2023-10-03
Distributed, Parallel, and Cluster Computing · Computer Science
A Synergy between On- and Off-Chip Data Reuse for GPU-based Out-of-Core Stencil Computation
Jingcheng Shen, Linbo Long, Jun Zhang, Weiqi Shen +2
2023-09-19
Hardware Architecture · Computer Science
Stream Semantic Registers: A Lightweight RISC-V ISA Extension Achieving Full Compute Utilization in Single-Issue Cores
Fabian Schuiki, Florian Zaruba, Torsten Hoefler, Luca Benini
2020-04-02
Hardware Architecture · Computer Science
Casper: Accelerating Stencil Computation using Near-cache Processing
Alain Denzler, Rahul Bera, Nastaran Hajinazar, Gagandeep Singh +3
2023-09-07
Computational Engineering, Finance, and Science · Computer Science
SparStencil: Retargeting Sparse Tensor Cores to Scientific Stencil Computations via Structured Sparsity Transformation
Qi Li, Kun Li, Haozhi Han, Liang Yuan +6
2025-07-01
Distributed, Parallel, and Cluster Computing · Computer Science
A Portable Framework for Accelerating Stencil Computations on Modern Node Architectures
Ryuichi Sai, John Mellor-Crummey, Jinfan Xu, Mauricio Araya-Polo
2024-07-09
Distributed, Parallel, and Cluster Computing · Computer Science
SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping
Qiqi GU, Chenpeng Wu, Heng Shi, Jianguo Yao
2026-01-27
Hardware Architecture · Computer Science
SpikeStream: Accelerating Spiking Neural Network Inference on RISC-V Clusters with Sparse Computation Extensions
Simone Manoni, Paul Scheffler, Luca Zanatta, Andrea Acquaviva +2
2025-04-09
Distributed, Parallel, and Cluster Computing · Computer Science
Compression-Based Optimizations for Out-of-Core GPU Stencil Computation
Jingcheng Shen, Xin Deng, Yifan Wu, Masao Okita +1
2022-04-26
Hardware Architecture · Computer Science
SASA: A Scalable and Automatic Stencil Acceleration Framework for Optimized Hybrid Spatial and Temporal Parallelism on HBM-based FPGAs
Xingyu Tian, Zhifan Ye, Alec Lu, Licheng Guo +2
2022-08-24
Programming Languages · Computer Science
Employing polyhedral methods to optimize stencils on FPGAs with stencil-specific caches, data reuse, and wide data bursts
Florian Mayer, Julian Brandner, Michael Philippsen
2024-01-25
Distributed, Parallel, and Cluster Computing · Computer Science
Stencil-HMLS: A multi-layered approach to the automatic optimisation of stencil codes on FPGA
Gabriel Rodriguez-Canal, Nick Brown, Maurice Jamieson, Emilien Bauer +2
2023-10-04
Distributed, Parallel, and Cluster Computing · Computer Science
Stencil Computations on AMD and Nvidia Graphics Processors: Performance and Tuning Strategies
Johannes Pekkilä, Oskar Lappi, Fredrik Robertsén, Maarit J. Korpi-Lagg
2025-05-28
Distributed, Parallel, and Cluster Computing · Computer Science
Accelerating High-Order Stencils on GPUs
Ryuichi Sai, John Mellor-Crummey, Xiaozhu Meng, Mauricio Araya-Polo +1
2020-09-16
Distributed, Parallel, and Cluster Computing · Computer Science
Accelerating GPU-Based Out-of-Core Stencil Computation with On-the-Fly Compression
Jingcheng Shen, Yifan Wu, Masao Okita, Fumihiko Ino
2021-09-14
Data Structures and Algorithms · Computer Science
Fast Stencil Computations using Fast Fourier Transforms
Zafar Ahmad, Rezaul Chowdhury, Rathish Das, Pramod Ganapathi +2
2021-05-17
Distributed, Parallel, and Cluster Computing · Computer Science
StencilFlow: Mapping Large Stencil Programs to Distributed Spatial Computing Systems
Johannes de Fine Licht, Andreas Kuster, Tiziano De Matteis, Tal Ben-Nun +2
2021-01-12
Distributed, Parallel, and Cluster Computing · Computer Science
Scalable communication for high-order stencil computations using CUDA-aware MPI
Johannes Pekkilä, Miikka S. Väisälä, Maarit J. Käpylä, Matthias Rheinhardt +1
2022-05-11
Distributed, Parallel, and Cluster Computing · Computer Science
An MLIR Lowering Pipeline for Stencils at Wafer-Scale
Nicolai Stawinoga, David Katz, Anton Lydike, Justs Zarins +3
2026-01-27
Distributed, Parallel, and Cluster Computing · Computer Science
Fast Stencil-Code Computation on a Wafer-Scale Processor
Kamil Rocki, Dirk Van Essendelft, Ilya Sharapov, Robert Schreiber +6
2020-10-09
Distributed, Parallel, and Cluster Computing · Computer Science
Beyond 16GB: Out-of-Core Stencil Computations
Istvan Z Reguly, Gihan R Mudalige, Michael B Giles
2017-10-27