LLM 能否像消费者一样思考?基于 ConsumerSimBench 的群体级反应重构基准
计算与语言
2026-05-19 v1 人工智能
计算机与社会
摘要
大语言模型(LLM)日益被用作“数字消费者”,用于模拟公众舆论、预测试营销决策并预测观众反应。然而,现有评估很少询问模型能否重构真实消费者在公共话语中呈现的具体反应模式。我们引入ConsumerSimBench,基于1,553个真实中国社交媒体主题和23,122个原子化、经规则审核的准则构建基准,涵盖四类反应家族。与仅用整体偏好判官对开放式生成进行评分不同,ConsumerSimBench将每个任务分解为对具体反应点的可审核的yes-no决策,将三个判官一致性从65.8%提升到92.1%,并使基于点评判官决策与人类多数标签的一致性达到98.4%。在13个前沿生成器中,最强模型Gemini-3.1-Pro仅覆盖47.8%的真实反应准则,而GPT-5.2和Claude-4.6在技术基准上表现突出,但在社会导向的消费者直觉方面远远落后。这些失败揭示了技术基准表现与社会导向消费者直觉之间的鲜明鸿沟。直接的结构化推理提示会降低覆盖率,而生成-反思多智能体管道将MiMo-V2.5-Pro在子集上的覆盖率从32.9%提升到37.6%。ConsumerSimBench将消费者模拟重新定义为对真实公共话语反应的预测问题,表明前沿LLM距离可靠预测真实消费者在高情境中国消费者话语中会关注的事物仍然遥远。
引用
@article{arxiv.2605.17079,
title = {Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench},
author = {Tianyu Wang and Jiajun Li and Jianghao Lin},
journal= {arXiv preprint arXiv:2605.17079},
year = {2026}
}