中文

智能体面临挑战时是否会修复?——挑战、修复与公共纠正在部署型智能体论坛中的探讨

计算机与社会 2026-04-03 v2

摘要

随着大型语言模型(LLM)智能体被部署到公开交互环境中,一个关键问题是其社区是否能够维持挑战、修复和公共纠正,或者仅仅生成类似规范的语言。我们将部署型智能体论坛Moltbook与五个匹配的Reddit社区进行比较,通过追踪三个步骤的机制:讨论是否创建线程式交流、挑战是否引发响应、纠正是否对更广泛的线程可见。相对于Reddit,Moltbook的讨论大约少制造了十倍的线程式交流,为挑战和响应提供了更少的机会。当挑战发生时,原作者几乎从不返回(仅1.2% vs Reddit上的40.9%),多轮继续几乎不存在(仅0.1% vs 38.5%),我们在共享保守协议下未检测到任何修复。Reddit内的一种非挑战基线建议,这一差距与挑战有关,而不仅仅是更深的线程。这些结果表明,社交对齐不仅仅取决于产生规范意识的语言,还取决于通过社区教导、执行和修订规范的互动过程的可持续性。这对安全性至关重要,因为纠正正变得去中心化;对于公平性也很重要,因为不同社区对参与者如何应对挑战有不同的期望。

关键词

引用

@article{arxiv.2604.00518,
  title  = {Do Agents Repair When Challenged -- or Just Reply? Challenge, Repair, and Public Correction in a Deployed Agent Forum},
  author = {Luyang Zhang and Yi-Yun Chu and Jialu Wang and Beibei Li and Ramayya Krishnan},
  journal= {arXiv preprint arXiv:2604.00518},
  year   = {2026}
}