中文

人工 Hivemind:语言模型及其超越的开放式同质性

计算与语言 2025-10-28 v1

摘要

语言模型(LM)常在生成多样化、贴近人类的创造性内容方面存在困难,担忧其通过反复暴露于相似输出而导致人类思想长期同质化。然而,针对 LM 输出多样性的可扩展评估方法仍有限,尤其是超越狭窄任务(如随机数或姓名生成)或单一模型多次抽样的情形。我们引入 Infinity-Chat,一个包含 2.6 万条多样化、真实世界、开放式用户查询的数据集,这些查询 admits 多种合理答案且无唯一参考答案。我们提出首个系统化分类框架,用于刻画 LM 面对开放式提示的全谱特征,包含 6 大类(如头脑风暴与构思)及其 17 小类。基于 Infinity-Chat,我们对 LM 的模式崩溃进行大规模研究,发现 LM 在开放式生成中呈现显著的 Artificial Hivemind 效应,包括:① 同一模型内重复,即单一模型持续生成相似响应;② 不同模型间同质性,即不同模型产出出人意料地相似。Infinity-Chat 还包含 31,250 条人类标注,覆盖绝对评分与成对偏好,单条示例平均有 25 位独立人类标注。这一资源使我们得以研究对开放式查询的集体偏好与个体差异。我们的发现表明,LM、奖励模型与 LM 评判器在评估引发标注者差异化偏好的模型生成时,人类评分校准水平不足,但整体质量保持 comparable。INFINITY-CHAT 首次提供大规模资源,系统性研究 LM 的真实世界开放式查询,揭示了缓解 Artificial Hivemind 长期 AI 安全风险的关键洞见。

关键词

引用

@article{arxiv.2510.22954,
  title  = {Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)},
  author = {Liwei Jiang and Yuanjun Chai and Margaret Li and Mickel Liu and Raymond Fok and Nouha Dziri and Yulia Tsvetkov and Maarten Sap and Alon Albalak and Yejin Choi},
  journal= {arXiv preprint arXiv:2510.22954},
  year   = {2025}
}

备注

NeurIPS 2025 D&B Paper (Oral); Camera-Ready Version