多智能体喜剧俱乐部:探讨社区讨论对大语言模型幽默生成的影响
计算与语言
2026-02-18 v2 人工智能
计算机与社会
人机交互
摘要
先前工作探索了多轮交互和反馈用于 LLM 写作,但评估仍主要集中在提示和局部反馈上,留下了在线社区中公共接受度的问题未得到充分考察。我们在受控的多智能体沙箱环境中测试了广播式社区讨论是否能提升脱口秀创作。实验中,讨论条件会记录、筛选、存储社交记忆,并在后续生成时检索以作为条件;基准方法则省略了讨论环节。我们进行了 50 轮实验(共 250 组对比单曲),由 5 位专家评审采用 A/B 偏好测试和 15 项评估量表进行打分。结果显示,讨论条件在 75.6% 的情况下获胜,并在 Craft/Clarity ({Delta} = 0.440) 和 Social Response ({Delta} = 0.422) 上实现提升,尽管偶尔会导致更激进的幽默。
引用
@article{arxiv.2602.14770,
title = {Multi-Agent Comedy Club: Investigating Community Discussion Effects on LLM Humor Generation},
author = {Shiwei Hong and Lingyao Li and Ethan Z. Rong and Chenxinran Shen and Zhicong Lu},
journal= {arXiv preprint arXiv:2602.14770},
year = {2026}
}
备注
18 pages, 5 figures