LLM 角色作为方法基准测试中现场实验的替代方案
人工智能
2026-01-30 v3 机器学习
计量经济学
摘要
现场实验(A/B 测试)通常是社会系统中方法(算法)最可信的基准,但其成本和延迟瓶颈阻碍了快速的方法论进步。基于 LLM 的角色模拟提供了一种廉价的合成替代方案,但目前尚不清楚用角色替代人类是否能保留自适应方法所优化的基准接口。我们证明了一个充要条件特征:当 (i) 方法仅观察聚合结果(仅聚合观察)且 (ii) 评估仅依赖于提交的制品,而不依赖于方法的身份或来源(方法盲评估)时,从方法的角度看,将人类替换为角色仅仅是面板变更,与改变评估人群(例如,从纽约到雅加达)无法区分。此外,我们从有效性转向有用性:我们定义了诱导聚合通道的信息论可区分性,并表明使角色基准测试与现场实验具有同等的决策相关性,本质上是一个样本量问题,从而给出了在选定分辨率下可靠区分有显著差异的方法所需的独立角色评估次数的明确界限。
引用
@article{arxiv.2512.21080,
title = {LLM Personas as a Substitute for Field Experiments in Method Benchmarking},
author = {Enoch Hyunwook Kang},
journal= {arXiv preprint arXiv:2512.21080},
year = {2026}
}