面向 LLM 策略优化的自适应仿真实验
机器学习
2026-04-13 v1
摘要
大型语言模型 (LLM) 在运营管理中具有显著的提升运营效率的潜力。部署这些模型需要指定一种政策,该政策治理响应质量、塑造用户体验并影响运营价值。在本研究中,我们将 LLM 视为随机模拟器,提出一种基于两两比较的自适应仿真实验框架,用于从有限的候选策略集合中识别最优政策。我们考虑两种政策空间:一种是无参数假设的非结构化空间,另一种是数据生成于偏好模型的结构化空间。对于这两种设置,我们 characterize 确定以高概率识别最优政策的基本数据要求。在非结构化情况下,我们推导出最优抽样比例的闭式表达式,并提供清晰的操作解释。在结构化情况下,我们 formulate 一个正则化凸规划以计算最优比例。随后,我们开发了一种自适应实验程序,称为 LLM-PO,适用于两种政策空间,并证明其在获得所需统计保证的同时,渐进地达到基本数据要求。数值实验表明,LLM-PO 持续优于基准方法并提升 LLM 性能。
引用
@article{arxiv.2604.08779,
title = {Adaptive Simulation Experiment for LLM Policy Optimization},
author = {Mingjie Hu and Siyang Gao and Jian-qiang Hu and Enlu Zhou},
journal= {arXiv preprint arXiv:2604.08779},
year = {2026}
}