中文

面向模拟社交媒体用户的 LLM 评估:条件化评论预测的运行有效性

计算与语言 2026-03-27 v1 人工智能

摘要

大型语言模型 (LLM) 从探索性工具转向社会科学中的活跃“硅谷主体”的过程中,缺乏对运行有效性的广泛验证。本研究引入条件化评论预测 (CCP),该任务通过将生成输出与真实数字痕迹进行比较来预测模型如何对给定刺激进行用户评论。该框架使我们能够严格评估当前 LLM 在模拟社交媒体用户行为方面的能力。我们评估了英文、德文和卢森堡语场景下的开源 8B 参数模型 (Llama3.1、Qwen3、Ministral)。通过系统性比较提示策略 (显式 vs. 隐式) 和监督微调 (SFT) 的影响,我们识别出一种关键形式与内容解耦现象在低资源设置下的体现:尽管 SFT 使文本输出的表面结构 (长度和语法) 获得对齐,但会损害语义 grounding。 Furthermore,我们展示了在微调后,显式条件化 (生成的个人简介) 变得冗余,因为模型能够直接从行为历史中进行潜在推断。我们的发现挑战了当前“naive prompting”范式,提供了优先考虑真实行为痕迹而非描述性人物画像以实现高保真模拟的操作准则。

关键词

引用

@article{arxiv.2602.22752,
  title  = {Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction},
  author = {Nils Schwager and Simon Münker and Alistair Plum and Achim Rettinger},
  journal= {arXiv preprint arXiv:2602.22752},
  year   = {2026}
}

备注

14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco