大语言模型开发与评估中的因果方法
机器学习
2026-05-26 v1 机器学习
摘要
大语言模型(LLM)开发目前依赖于对数据混合物、奖励模型、路由策略和评估管线进行大规模经验性迭代。本文我们认为,LLM 开发和评估中的许多核心问题本质上是因果问题:添加数据域对预训练的影响是什么?当 LLM 以不同风格生成文本时,注释员偏好如何变化?在推理成本约束下,提示应路由到大型还是小型模型?总的来说,因果方法适用于干预改变结果的情境,但令人惊讶地在 LLM 开发中被低估。我们的贡献有三个方面:(1)我们解释了因果方法如何帮助发展现代 LLM 开发和评估:LLM 开发依赖大量数据,这些数据常受制于混杂和分布迁移;评估使用已学习但可能偏斜的评判器;部署环境是非平稳的。这些条件使得纯预测方法脆弱,并为来自因果推断的原则性识别和估计方法创造了机会。(2)我们进一步描绘了因果方法在整个 LLM 开发管线中的机会,包括预训练、对齐、路由、智能体工作流程和评估。(3)我们讨论了围绕利用因果方法进行 LLM 开发和评估的新研究机会。总体而言,我们认为尽管因果方法可以确保可靠且建立在科学基础上的设计,却在 LLM 开发和评估管线中被低估使用。
引用
@article{arxiv.2605.25997,
title = {Deployment-complete benchmarking},
author = {El Mustapha Mansouri and Keigo Arai},
journal= {arXiv preprint arXiv:2605.25997},
year = {2026}
}
备注
33 pages, 5 figures, 1 table; supplementary tables and code available