中文

集体图灵测试:大型语言模型可生成逼真的多用户讨论

计算与语言 2026-04-02 v1 人工智能

摘要

大型语言模型(LLM)为模拟在线社区和社交媒体上的对话提供了新的途径。潜在应用包括测试内容推荐算法的设计、估计内容政策和干预措施的效果。然而,利用大型语言模型模拟不同用户之间的对话的有效性尚未得到充分测试。我们评估了大型语言模型是否能够在社交媒体上生成逼真的人类小组对话。我们收集了来自 Reddit 的真实人类对话,并使用两个大型语言模型(Llama 3 70B 和 GPT-4o)生成相同主题的人工对话。当这些对话呈现给研究参与者进行比较时,人工生成的对话被误认为是人类创建的内容的比例为 39%。特别地,在评估由 Llama 3 生成的对话时,参与者正确识别其为 AI 生成的比例仅为 56%,仅略高于随机猜测。我们的研究表明,大型语言模型能够生成足够逼真的社交媒体对话,以致于在阅读时欺骗人类。这凸显了大型语言模型在社会模拟方面的广泛前景,也警示了大型语言模型被滥用生成新不实社交媒体内容的潜在风险。

关键词

引用

@article{arxiv.2511.08592,
  title  = {The Collective Turing Test: Large Language Models Can Generate Realistic Multi-User Discussions},
  author = {Azza Bouleimen and Giordano De Marzo and Taehee Kim and Nicol`o Pagan and Hannah Metzler and Silvia Giordano and Anikó Hannák and David Garcia},
  journal= {arXiv preprint arXiv:2511.08592},
  year   = {2026}
}