Computation and Language · Computer Science
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
Luca Soldaini, Rodney Kinney, Akshita Bhagia, Dustin Schwenk +32
2024-06-10
Computation and Language · Computer Science
LLMic: Romanian Foundation Language Model
Vlad-Andrei Bădoiu, Mihai-Valentin Dumitru, Alexandru M. Gherghescu, Alexandru Agache +1
2025-01-15
Computation and Language · Computer Science
Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza +6
2026-05-20
Computation and Language · Computer Science
OpenLLM-Ro -- Technical Report on Open-source Romanian LLMs
Mihai Masala, Denis C. Ilie-Ablachim, Dragos Corlatescu, Miruna Zavelca +5
2024-05-20
Computation and Language · Computer Science
Findings of the Second BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora
Michael Y. Hu, Aaron Mueller, Candace Ross, Adina Williams +6
2024-12-09
Computation and Language · Computer Science
A New Massive Multilingual Dataset for High-Performance Language Technologies
Ona de Gibert, Graeme Nail, Nikolay Arefyev, Marta Bañón +9
2024-03-22
Computation and Language · Computer Science
Filtered Corpus Training (FiCT) Shows that Language Models can Generalize from Indirect Evidence
Abhinav Patil, Jaap Jumelet, Yu Ying Chiu, Andy Lapastora +4
2024-08-08
Computation and Language · Computer Science
RoQLlama: A Lightweight Romanian Adapted Language Model
George-Andrei Dima, Andrei-Marius Avram, Cristian-George Crăciun, Dumitru-Clementin Cercel
2024-10-08
Computation and Language · Computer Science
Multilingual Pretraining Using a Large Corpus Machine-Translated from a Single Source Language
Jiayi Wang, Yao Lu, Maurice Weber, Max Ryabinin +3
2024-11-07
Computation and Language · Computer Science
FinGPT: Large Generative Models for a Small Language
Risto Luukkonen, Ville Komulainen, Jouni Luoma, Anni Eskelinen +17
2023-11-13
Computation and Language · Computer Science
Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
Stefan Krsteski, Matea Tashkovska, Borjan Sazdov, Hristijan Gjoreski +1
2025-10-13
Computation and Language · Computer Science
A Novel Cartography-Based Curriculum Learning Method Applied on RoNLI: The First Romanian Natural Language Inference Corpus
Eduard Poesina, Cornelia Caragea, Radu Tudor Ionescu
2024-10-21
Computation and Language · Computer Science
"Vorbe\c{s}ti Rom\^ane\c{s}te?" A Recipe to Train Powerful Romanian LLMs with English Instructions
Mihai Masala, Denis C. Ilie-Ablachim, Alexandru Dima, Dragos Corlatescu +9
2024-10-25
Computation and Language · Computer Science
Call for Papers -- The BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus
Alex Warstadt, Leshem Choshen, Aaron Mueller, Adina Williams +2
2023-01-30
Computation and Language · Computer Science
Quality at a Glance: An Audit of Web-Crawled Multilingual Datasets
Julia Kreutzer, Isaac Caswell, Lisa Wang, Ahsan Wahab +48
2022-02-22
Computation and Language · Computer Science
The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only
Guilherme Penedo, Quentin Malartic, Daniel Hesslow, Ruxandra Cojocaru +5
2023-06-05