大语言模型的特异性
计算与语言
2025-06-17 v2
摘要
在本工作中,我们揭示并研究了大语言模型(LLMs)中的特异性——其输出中可用于区分模型的独特模式。为此,我们考虑一个简单的分类任务:给定一段特定的文本输出,目标是预测生成该文本的源LLM。我们在各种LLM组上评估了这一合成任务,发现仅通过在LLM生成的文本上微调文本嵌入模型即可获得出色的分类准确率。特别地,我们在涉及ChatGPT、Claude、Grok、Gemini和DeepSeek的五分类问题中,在留出验证数据上达到了97.1%的准确率。进一步的研究揭示,这些特异性根植于词级分布。即使文本被外部LLM重写、翻译或总结,这些模式依然存在,表明它们也被编码在语义内容中。此外,我们利用LLM作为裁判,为每个模型的特异性生成详细、开放式的描述。最后,我们讨论了我们的发现的更广泛影响,包括在合成数据上训练、推断模型相似性以及LLM的鲁棒评估。代码可在 https://github.com/locuslab/llm-idiosyncrasies 获取。
引用
@article{arxiv.2502.12150,
title = {Idiosyncrasies in Large Language Models},
author = {Mingjie Sun and Yida Yin and Zhiqiu Xu and J. Zico Kolter and Zhuang Liu},
journal= {arXiv preprint arXiv:2502.12150},
year = {2025}
}
备注
Published in ICML 2025. Website at https://eric-mingjie.github.io/llm-idiosyncrasies/index.html