Computation and Language · Computer Science
To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining
Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao +3
2026-04-02
Machine Learning · Computer Science
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
Jakub Krajewski, Amitis Shidani, Dan Busbridge, Sam Wiseman +1
2025-12-10
Computation and Language · Computer Science
Scaling Laws for Predicting Downstream Performance in LLMs
Yangyi Chen, Binxuan Huang, Yifan Gao, Zhengyang Wang +2
2025-04-09
Computation and Language · Computer Science
Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment
Kun Luo, Minghao Qin, Zheng Liu, Shitao Xiao +2
2024-08-26
Computation and Language · Computer Science
Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali +6
2025-10-08
Computation and Language · Computer Science
Large Language Models are Strong Zero-Shot Retriever
Tao Shen, Guodong Long, Xiubo Geng, Chongyang Tao +2
2023-08-03
Machine Learning · Computer Science
Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
Athanasios Glentis, Jiaxiang Li, Qiulin Shang, Andi Han +3
2025-05-30
Computation and Language · Computer Science
Evaluating Large Language Models for Cross-Lingual Retrieval
Longfei Zuo, Pingjun Hong, Oliver Kraus, Barbara Plank +1
2025-09-19
Computation and Language · Computer Science
Efficiency-Effectiveness Reranking FLOPs for LLM-based Rerankers
Zhiyuan Peng, Ting-ruen Wei, Tingyu Song, Yilun Zhao
2025-10-10
Computation and Language · Computer Science
Language Models Improve When Pretraining Data Matches Target Tasks
David Mizrahi, Anders Boesen Lindbo Larsen, Jesse Allardice, Suzie Petryk +6
2025-07-17
Information Retrieval · Computer Science
Exploring Training and Inference Scaling Laws in Generative Retrieval
Hongru Cai, Yongqi Li, Ruifeng Yuan, Wenjie Wang +3
2025-06-10
Computer Vision and Pattern Recognition · Computer Science
Indexing Multimodal Language Models for Large-scale Image Retrieval
Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid +1
2026-04-16
Computation and Language · Computer Science
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
Zhengliang Shi, Yuhan Wang, Lingyong Yan, Pengjie Ren +3
2025-05-27
Machine Learning · Computer Science
Predicting Language Models' Success at Zero-Shot Probabilistic Prediction
Kevin Ren, Santiago Cortes-Gomez, Carlos Miguel Patiño, Ananya Joshi +6
2025-09-22
Distributed, Parallel, and Cluster Computing · Computer Science
Scaling Studies for Efficient Parameter Search and Parallelism for Large Language Model Pre-training
Michael Benington, Leo Phan, Chris Pierre Paul, Evan Shoemaker +4
2023-10-12
Computation and Language · Computer Science
How Predictable Are Large Language Model Capabilities? A Case Study on BIG-bench
Qinyuan Ye, Harvey Yiyun Fu, Xiang Ren, Robin Jia
2023-11-01
Performance · Computer Science
Dissecting the Runtime Performance of the Training, Fine-tuning, and Inference of Large Language Models
Longteng Zhang, Xiang Liu, Zeyu Li, Xinglin Pan +7
2023-12-04
Computation and Language · Computer Science
MLP Memory: A Retriever-Pretrained Memory for Large Language Models
Rubin Wei, Jiaqi Cao, Jiarui Wang, Jushi Kai +3
2026-03-02
Computation and Language · Computer Science
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
Rulin Shao, Jacqueline He, Akari Asai, Weijia Shi +4
2024-07-19
Computation and Language · Computer Science
How Good are LLM-based Rerankers? An Empirical Analysis of State-of-the-Art Reranking Models
Abdelrahman Abdallah, Bhawna Piryani, Jamshid Mozafari, Mohammed Ali +1
2025-08-26