大型语言模型能否革命化调查研究?对灾害准备反应的实验
人工智能
2026-05-20 v1
摘要
调查研究面临响应率下降、样本偏差、在危险人群中块状缺失以及AI辅助的网络小组欺诈完成等结构性挑战。大型语言模型(LLM)被提出作为解决方案,但在完整调查工作流程中进行严格评估仍稀少,特别是在数据质量最关键的灾害情境下。我们提出并评估了一个覆盖问卷设计、样本选择、试点测试、缺失数据插值和收集后分析五个阶段的LLM集成框架,以2024年佛罗里达沃克弗里克斯灾害准备调查(n=946)作为共享实证测试平台。我们引入了受保护动机理论(PMT)约束的共现知识图谱,开发了七种LLM配置,涵盖零样本推理、检索增强基线和新颖的理论导向变体。我们提出的以PMT因果结构组织检索并将所有证据集成到单次模型调用中的锚定边际理论信息LLM(A-TLM)在灾害相关块状MNAR条件下 outperform了三种经典插值基线(IPW/MI, MICE+PMM, missForest),在S4 RMSE上达1.439 vs. 1.496(第二好者),在随机森林插值器产生最大绝对偏差(-0.631)的地方实现了接近零的有符号偏差(-0.121)。将检索组织化于PMT因果结构并在单一模型调用中整合所有证据的做法优于非结构化检索和分阶段顺序推理(MAE 0.993 vs. 1.097用于标准RAG)。我们记录到接近零聚合偏差可掩盖对子组错误,提出作为报告标准的子组分层偏差审计。一种受检索约束的知识图谱聊天机器人演示了通过基于 grounding的拒绝可管理地控制幻觉。
引用
@article{arxiv.2605.19229,
title = {Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses},
author = {Yan Wang and Ziyi Guo and Christopher McCarty},
journal= {arXiv preprint arXiv:2605.19229},
year = {2026}
}