映射大语言模型在模拟人类人格特质、社会人口统计特征与社交媒体行为时对社会议题的辩论方式
计算与语言
2026-05-01 v1 人工智能
计算机与社会
人机交互
机器学习
摘要
大语言模型(LLMs)能够深刻塑造社会话语,然而,探究LLM输出如何在不同受控社会与情境提示下变化的数据集仍然稀缺。认知数字影子(CDS)是一个包含19万条记录的合成语料库,旨在支持对LLM生成话语的分析。每条CDS记录均由19个LLM之一生成,并被提示模拟一个人类角色或一个AI助手角色。CDS包含LLM对4个有争议的社会议题的回应:疫苗/医疗保健、社交媒体虚假信息、科学领域的性别差距以及STEM刻板印象。受角色条件控制的记录编码了17种社会人口学和心理学属性,提供了将LLM的提示、语言、立场和推理联系起来的数据。文本经过主题锚定验证,并可通过可解释的自然语言处理(例如文本形式心智网络)支持情感分析。CDS通过一个带有用户友好仪表板的汇总平台得到增强,能够对跨角色、议题和模型的情感和语义框架进行便捷、交互式的组级比较。CDS提示框架支持未来对LLM的偏见、社会敏感性和对齐性进行审计。
引用
@article{arxiv.2604.27624,
title = {Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behavior},
author = {Ali Aghazadeh Ardebili and Massimo Stella},
journal= {arXiv preprint arXiv:2604.27624},
year = {2026}
}