大型语言模型输出的全面分析:相似性、多样性与偏见
计算与语言
2025-05-15 v1
摘要
大型语言模型 (LLM) 代表了通用人工智能的重要进步,显著提升了我们与技术交互的能力。尽管LLM在自然语言处理任务中表现出色——如翻译、生成、代码编写和摘要——但仍存疑问:它们的输出如何相似?不同模型之间有何差异?哪些模型最能体现伦理标准?为此,我们使用5000个涵盖生成、解释和改写等多样任务的提示,产生约300万篇文本来分析12个LLM,包括来自OpenAI、Google、Microsoft、Meta和Mistral的专有和开源系统。关键发现包括:(1)同一LLM生成的输出与彼此更相似,而与人类编写的文本较为不同;(2)像 WizardLM-2-8x22b 这样的模型生成高度相似的输出,而GPT-4则产生更具变异性的响应;(3)LLM的写作风格差异显著,Llama 3 和 Mistral 显示更高的相似性,而GPT-4 在独特性方面表现突出;(4)词汇和语气的差异凸显了LLM生成内容的语言独特性;(5)一些LLM表现出更好的性别平衡和较低的偏见。这些结果为理解LLM输出的行为和多样性提供了新见解,帮助指导未来的发展和伦理评估。
引用
@article{arxiv.2505.09056,
title = {A Comprehensive Analysis of Large Language Model Outputs: Similarity, Diversity, and Bias},
author = {Brandon Smith and Mohamed Reda Bouadjenek and Tahsin Alamgir Kheya and Phillip Dawson and Sunil Aryal},
journal= {arXiv preprint arXiv:2505.09056},
year = {2025}
}