面向 LLM-Agent 社交模拟的运行时效性验证:对 Reddit 类技术论坛的复现研究
计算机与社会
2026-04-27 v3 社会与信息网络
物理与社会
摘要
LLM-agent 社交模拟的验证仍不成熟,大多数研究依赖主观评估或单次运行。我们通过对基于 Voat v/technology 论坛建模的技术论坛进行 30 次独立的 30 天模拟,使用 stateless Dolphin Mistral 24B 智能体在 Y Social 平台上运行,并在五个维度上评估运营有效性:活动模式、网络结构、毒性、主题覆盖和风格收敛。与 30 个匹配且不重叠的 30 天 Voat 比较窗口相比,结果显示唯一用户、根帖和每日活跃用户的置信区间重合率达 99%,而评论、平均线程长度和平均毒性在模拟中仍高于实际数据。模拟和实证网络都呈现出核心-外围结构,尽管模拟核心更大且更为扩散,重复互动频率较低。主题对齐几乎完整,但毒性在内容层面上被错误分配:模拟根帖显著比真实提交更具毒性,而模拟评论则不如 Voat 评论那样具毒性。这些发现表明,在符合平台的环境中,LLM 智能体能够复现熟悉的线上常规,而与无状态智能体设计和内容层校准有关的系统性差异,指向了未来改进的具体方向。
引用
@article{arxiv.2508.21740,
title = {Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum},
author = {Aleksandar Tomašević and Darja Cvetković and Sara Major and Slobodan Maletić and Miroslav Anđelković and Ana Vranić and Boris Stupovski and Dušan Vudragović and Aleksandar Bogojević and Marija Mitrović Dankulov},
journal= {arXiv preprint arXiv:2508.21740},
year = {2026}
}