从人口统计学到调查锚点:评估 LLM 代理在模拟退休态度中的表现
计算机与社会
2026-05-19 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)代理可能提供预测人类对调查作答的工具。常用的定义方法仅使用人口统计学特征,例如国家、年龄、性别、就业状态、收入、教育程度和婚姻状况。我们比较了仅基于人口统计学的代理预测精度与基于更广泛领域调查响应的代理预测精度。我们在以 SHARE(Survey of Health, Ageing and Retirement in Europe,欧洲健康、年龄与退休调查)为主题的跨国、跨学科调查中进行测试,聚焦个人财务三个与政策相关构念的五个变量。在这三个构念中,我们观察到,与基于更广泛数据训练的调查锚定代理相比,仅基于人口统计学的代理(1)表现出中心倾向偏差,倾向于将答案拉向人口均值;(2)显得不切实际地准确,未能再现典型人类作答者常见的错误答案和“不知道”选项。通过复制先前退休规划研究中的层次回归分析,这些性能差异得到进一步佐证。仅基于人口统计学的代理能够复现财务风险容忍度、未来时间视角和退休规划知识这三者各自预测退休储蓄的结论。然而,只有基于调查锚定的代理才能再现这三者之间的相互作用。这一发现表明,在仅使用人口统计学信息定义 LLM 代理用于预测调查作答时应持谨慎态度。
引用
@article{arxiv.2605.16303,
title = {From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes},
author = {Rubén Garzón and Pauline Baron and Vincent Grari and Jonne Kamphorst and Michael Bernstein and Marcin Detyniecki},
journal= {arXiv preprint arXiv:2605.16303},
year = {2026}
}
备注
50 pages, 22 figures