Artificial Intelligence · Computer Science
Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts
Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le +11
2026-02-17
Audio and Speech Processing · Electrical Eng. & Systems
RepCNN: Micro-sized, Mighty Models for Wakeword Detection
Arnav Kundu, Prateeth Nayak, Priyanka Padmanabhan, Devang Naik
2024-08-05
Computation and Language · Computer Science
Are Large Language Models Economically Viable for Industry Deployment?
Abdullah Mohammad, Sushant Kumar Ray, Pushkar Arora, Rafiq Ali +4
2026-04-22
Machine Learning · Computer Science
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang +30
2025-09-24
Artificial Intelligence · Computer Science
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun
2026-03-17
Machine Learning · Computer Science
Not all tokens are needed(NAT): token efficient reinforcement learning
Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He +1
2026-03-10
Computation and Language · Computer Science
Bridging the Gap for Tokenizer-Free Language Models
Dokook Choe, Rami Al-Rfou, Mandy Guo, Heeyoung Lee +1
2019-08-28
Computation and Language · Computer Science
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
Bingxiang He, Zekai Qu, Zeyuan Liu, Yinghao Chen +8
2025-12-19
Computation and Language · Computer Science
Playing with Words, Improving with Rewards: Training Language Models for Creative Association
Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude +4
2026-05-28
Computation and Language · Computer Science
Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models
Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le +15
2025-12-09
Computation and Language · Computer Science
Language Models that Think, Chat Better
Adithya Bhaskar, Xi Ye, Danqi Chen
2025-09-25
Machine Learning · Computer Science
Learning to Reason in 13 Parameters
John X. Morris, Niloofar Mireshghallah, Mark Ibrahim, Saeed Mahloujifar
2026-02-05
Machine Learning · Computer Science
Large Scale Language Modeling: Converging on 40GB of Text in Four Hours
Raul Puri, Robert Kirby, Nikolai Yakovenko, Bryan Catanzaro
2018-08-14
Artificial Intelligence · Computer Science
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li +4
2026-05-12
Computation and Language · Computer Science
Query-focused and Memory-aware Reranker for Long Context Processing
Yuqing Li, Jiangnan Li, Mo Yu, Guoxuan Ding +3
2026-03-11
Artificial Intelligence · Computer Science
Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learning
Haiming Wang, Mert Unsal, Xiaohan Lin, Mantas Baksys +36
2025-04-16
Information Retrieval · Computer Science
REARANK: Reasoning Re-ranking Agent via Reinforcement Learning
Le Zhang, Bo Wang, Xipeng Qiu, Siva Reddy +1
2025-05-27
Machine Learning · Computer Science
RaanA: A Fast, Flexible, and Data-Efficient Post-Training Quantization Algorithm
Yongyi Yang, Jianyang Gao, Wei Hu
2025-11-03
Computation and Language · Computer Science
JT-Math: A Multi-Stage Framework for Advanced Mathematical Reasoning in Large Language Models
Yifan Hao, Fangning Chao, Yaqian Hao, Zhaojun Cui +5
2025-07-29
Computation and Language · Computer Science
Kanana: Compute-efficient Bilingual Language Models
Kanana LLM Team, Yunju Bak, Hojin Lee, Minho Ryu +25
2025-03-03
Computation and Language · Computer Science
Using Language Models on Low-end Hardware
Fabian Ziegner, Janos Borst, Andreas Niekler, Martin Potthast
2023-05-09
Machine Learning · Computer Science
LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
Ang Li, Yifei Wang, Zhihang Yuan, Stefanie Jegelka +1
2025-10-21
Computation and Language · Computer Science
Investigating Low-Rank Training in Transformer Language Models: Efficiency and Scaling Analysis
Xiuying Wei, Skander Moalla, Razvan Pascanu, Caglar Gulcehre
2024-07-25