行为稳定,差异有限:城市情感感知中 LLM 智能体的角色有效性
计算与语言
2026-05-25 v2 社会与信息网络
摘要
大语言模型(LLMs)越来越多地被用作城市分析中人类感知的代理,但角色提示是否会产生有意义且可复现的行为多样性仍不清楚。我们研究了不同角色是否会影响多模态 LLM 生成的城市情感判断。通过使用涵盖性别、经济状况、政治倾向和个性的因子角色集,我们为每个角色实例化多个智能体,以评估来自 PerceptSent 数据集的城市场景图像,并评估角色内一致性和角色间差异。结果显示,共享同一角色的智能体之间表现出强收敛性,表明行为稳定且可复现。然而,角色间的区分度有限:经济状况和个性引发了统计上可检测但实际意义不大的差异,而性别没有显示出可测量的影响,政治倾向的影响也微乎其微。智能体还表现出极端化偏差,即压缩了人类标注中常见的中间情感类别。因此,在粗粒度的极性任务上性能依然强劲,但随着情感分辨率的提高,性能会下降,这表明简单的基于标签的角色提示无法捕捉细粒度的感知判断。为了分离角色条件化的贡献,我们额外评估了无角色的同一模型。令人惊讶的是,无角色模型在所有任务变体上与人类标签的一致性有时会匹配甚至超过角色条件模型,这表明在此设置中,简单的基于标签的角色提示可能增加的标注价值有限。
引用
@article{arxiv.2604.28048,
title = {Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception},
author = {Neemias B da Silva and Rodrigo Minetto and Daniel Silver and Thiago H Silva},
journal= {arXiv preprint arXiv:2604.28048},
year = {2026}
}
备注
8 pages, 8 figures. IEEE DCOSS - UrbCom