日志的部分见证:模型选择受控下的语言模型生成评估
机器学习
2026-05-05 v1 计量经济学
应用统计
机器学习
摘要
当模型选择受控时,对语言模型生成的离线评估存在偏差:相同的用户侧因素既影响哪个模型被使用,又影响其输出的评估,因此,原始日志分数比较混合了自选人群,而非估计感兴趣的共同量。小规模随机实验可通过覆盖模型选择来打破这种偏差,但实际中此类实验稀少且昂贵。我们研究一种三源设计,结合大规模受控观察日志 (OBS) 以获取规模、小规模随机实验 (EXP) 以实现无控制评分,以及离线模拟器 (SIM) 用于在缓存上下文上重放候选模型。我们的主要结果是表明,随机实验与模拟器共同即可恢复因果模型值;观察日志随后仅用于降低估计误差,而非使因果比较有效。六类估计器在受控半合成验证中以及两个真实任务缓存基准(摘要生成和代码生成)中进行评估。没有哪一类在所有情形下都占优;相对性能取决于无偏 EXP 监督的多少,以及目标奖励与 OBS 派生结构的接近程度。
引用
@article{arxiv.2605.01311,
title = {The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice},
author = {Jikai Jin and Vasilis Syrgkanis},
journal= {arXiv preprint arXiv:2605.01311},
year = {2026}
}