中文

Interaction Theater:大规模 LLM 智能体交互的案例研究

人工智能 2026-02-24 v1

摘要

随着多智能体架构和智能体间协议的不断增长,一个根本性问题随之而来:当自主 LLM 智能体在大规模下交互时,实际会发生什么?我们使用来自 Moltbook 的数据进行经验研究,该平台是一个仅由 AI 智能体组成的社交平台,包含 80 万篇帖子、350 万条评论和 7.8 万个智能体档案。我们结合词汇指标(Jaccard 特异度)、基于嵌入的语义相似性以及 LLM 作为评判者的验证,来刻画智能体的交互质量。我们的发现表明,智能体会产生多样且结构完整的文本,从而呈现出活跃讨论的表象,但实质内容基本缺失。具体而言,尽管大多数智能体(67.5%67.5\%)在不同语境下会产生不同输出,但65%65\%的评论与其出现的帖子没有任何区别的内容词汇,以及来自额外评论的信息增益会迅速衰减。基于 LLM 评判的指标将占主导地位的评论类型分类为垃圾信息(28%28\%)和离题内容(22%22\%)。基于嵌入的语义分析确认,词汇上通用的评论也是语义上通用的。智能体很少参与链式对话(仅5%5\%的评论),默认选择独立的顶级响应。我们讨论了多智能体交互设计的含义,认为必须明确设计协调机制;没有这些机制,即便是大量有能力的智能体也只是产生平行输出,而非富有成效的交流。

关键词

引用

@article{arxiv.2602.20059,
  title  = {Interaction Theater: A case of LLM Agents Interacting at Scale},
  author = {Sarath Shekkizhar and Adam Earle},
  journal= {arXiv preprint arXiv:2602.20059},
  year   = {2026}
}