大语言模型能否模拟人类响应?面向供暑相关选择的陈述偏好实验案例研究
计算与语言
2025-08-25 v3 人工智能
计算机与社会
摘要
陈述偏好 (SP) 调查是研究个体在假设性、亦即未来情景中进行权衡的关键方法。在能源背景下,这包括关键的脱碳实现情境,如低碳技术、分布式可再生能源生成及需求侧响应等 [1,2]。然而,这些调查往往成本高昂、耗时,而且可能受到受访者疲劳及伦理约束的影响。大型语言模型 (LLM) 在生成类人文本响应方面已展现出惊人的能力,推动了其在调查研究中的应用日益增长。本研究探讨了使用 LLM 模拟能源相关 SP 调查中消费者选择的可能性,并探索其集成到数据分析工作流程中的作用。设计了一系列测试情景,以系统性评估几种 LLM(LLaMA 3.1、Mistral、GPT-3.5 和 DeepSeek-R1)在个体与聚合水平上的模拟性能,考虑到提示设计、情境学习 (ICL)、链式思维 (CoT) 推理、LLM 类型、与传统选择模型的集成以及潜在偏见等情境因素。云端 LLM 不一定在准确率上优于较小的本地模型。本研究中,推理模型 DeepSeek-R1 实现了最高的平均准确率(77%),在准确率、因素识别及选择分布对齐方面均优于非推理 LLM。跨模型而言,针对燃气锅炉和无改造选项的系统性偏见较大,倾向于更偏好高效能方案。我们的发现表明,之前的 SP 选择是最有效的输入因素,而较长的提示以及额外因素和 varied formats 可能会导致 LLM 偏离焦点,从而降低准确率。
引用
@article{arxiv.2503.10652,
title = {Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices},
author = {Han Wang and Jacek Pawlak and Aruna Sivakumar},
journal= {arXiv preprint arXiv:2503.10652},
year = {2025}
}