LLM 的涌现行为在观测上与数据泄露等价
计算与语言
2025-06-02 v1 计算机科学与博弈论
摘要
Ashery 等人最近提出,当大语言模型(LLMs)配对进行经典的“命名游戏”时,会自发发展出类似于人类社会规范的语言惯例。在此,我们表明他们的结果可以用数据泄露更好地解释:模型只是再现了它们在预训练期间已经遇到的惯例。尽管原作者采取了缓解措施,我们提供了多项分析证明,LLMs 识别出了协调博弈的结构并回忆起其结果,而不是表现出“涌现的”惯例。因此,观察到的行为与对训练语料库的记忆无法区分。最后,我们指出了潜在的替代策略,并更广泛地反思了 LLMs 在社会科学模型中的地位。
引用
@article{arxiv.2505.23796,
title = {Emergent LLM behaviors are observationally equivalent to data leakage},
author = {Christopher Barrie and Petter Törnberg},
journal= {arXiv preprint arXiv:2505.23796},
year = {2025}
}