PLLuM: A Family of Polish Large Language Models
Abstract
Large Language Models (LLMs) play a central role in modern artificial intelligence, yet their development has been primarily focused on English, resulting in limited support for other languages. We present PLLuM (Polish Large Language Model), the largest open-source family of foundation models tailored specifically for the Polish language. Developed by a consortium of major Polish research institutions, PLLuM addresses the need for high-quality, transparent, and culturally relevant language models beyond the English-centric commercial landscape. We describe the development process, including the construction of a new 140-billion-token Polish text corpus for pre-training, a 77k custom instructions dataset, and a 100k preference optimization dataset. A key component is a Responsible AI framework that incorporates strict data governance and a hybrid module for output correction and safety filtering. We detail the models' architecture, training procedures, and alignment techniques for both base and instruction-tuned variants, and demonstrate their utility in a downstream task within public administration. By releasing these models publicly, PLLuM aims to foster open research and strengthen sovereign AI technologies in Poland.
Cite
@article{arxiv.2511.03823,
title = {PLLuM: A Family of Polish Large Language Models},
author = {Jan Kocoń and Maciej Piasecki and Arkadiusz Janz and Teddy Ferdinan and Łukasz Radliński and Bartłomiej Koptyra and Marcin Oleksy and Stanisław Woźniak and Paweł Walkowiak and Konrad Wojtasik and Julia Moska and Tomasz Naskręt and Bartosz Walkowiak and Mateusz Gniewkowski and Kamil Szyc and Dawid Motyka and Dawid Banach and Jonatan Dalasiński and Ewa Rudnicka and Bartłomiej Alberski and Tomasz Walkowiak and Aleksander Szczęsny and Maciej Markiewicz and Tomasz Bernaś and Hubert Mazur and Kamil Żyta and Mateusz Tykierko and Grzegorz Chodak and Tomasz Kajdanowicz and Przemysław Kazienko and Agnieszka Karlińska and Karolina Seweryn and Anna Kołos and Maciej Chrabąszcz and Katarzyna Lorenc and Aleksandra Krasnodębska and Artur Wilczek and Katarzyna Dziewulska and Paula Betscher and Zofia Cieślińska and Katarzyna Kowol and Daria Mikoś and Maciej Trzciński and Dawid Krutul and Marek Kozłowski and Sławomir Dadas and Rafał Poświata and Michał Perełkiewicz and Małgorzata Grębowiec and Maciej Kazuła and Marcin Białas and Roman Roszko and Danuta Roszko and Jurgita Vaičenonienė and Andrius Utka and Paweł Levchuk and Paweł Kowalski and Irena Prawdzic-Jankowska and Maciej Ogrodniczuk and Monika Borys and Anna Bulińska and Wiktoria Gumienna and Witold Kieraś and Dorota Komosińska and Katarzyna Krasnowska-Kieraś and Łukasz Kobyliński and Martyna Lewandowska and Marek Łaziński and Mikołaj Łątkowski and Dawid Mastalerz and Beata Milewicz and Agnieszka Anna Mykowiecka and Angelika Peljak-Łapińska and Sandra Penno and Zuzanna Przybysz and Michał Rudolf and Piotr Rybak and Karolina Saputa and Aleksandra Tomaszewska and Aleksander Wawer and Marcin Woliński and Joanna Wołoszyn and Alina Wróblewska and Bartosz Żuk and Filip Żarnecki and Konrad Kaczyński and Anna Cichosz and Zuzanna Deckert and Monika Garnys and Izabela Grabarczyk and Wojciech Janowski and Sylwia Karasińska and Aleksandra Kujawiak and Piotr Misztela and Maria Szymańska and Karolina Walkusz and Igor Siek and Jakub Kwiatkowski and Piotr Pęzik},
journal= {arXiv preprint arXiv:2511.03823},
year = {2025}
}
Comments
83 pages, 19 figures