罗塞塔悖论:大型语言模型中的领域特定性能反转
计算与语言
2024-12-25 v1 人工智能
摘要
尽管大型语言模型(如GPT和BERT)已在自然语言处理及领域特定应用方面展示了前所未有的能力,但出现了一种我们称之为罗塞塔悖论的未探索现象。罗塞塔悖论描述了知识领域之间性能的反向转变。该悖论捕捉了这些大型语言模型如何在高度专业化领域表现出色,却在需要常规日常知识的任务中表现不佳。本文正式定义罗塞塔悖论,提出包括领域特定指数(DSI)和性能逆转指标(PIM)于内的全景分析框架,用于一致量化大型语言模型中的领域特定行为。我们采用该悖论并通过在多样化模型和知识领域(从丰富的技术领域到常识推理)中的大规模实验进行调查。我们的发现表明,罗塞塔悖论可能并非数据分布的偶然产物,而是深度神经网络的内在结构和涌现性特性。我们present了不同模型架构、规模和训练方法的比较分析,阐明了该悖论如何表现出来,并挑战了标准评估指标。
引用
@article{arxiv.2412.17821,
title = {The Rosetta Paradox: Domain-Specific Performance Inversions in Large Language Models},
author = {Basab Jha and Ujjwal Puri},
journal= {arXiv preprint arXiv:2412.17821},
year = {2024}
}
备注
15 pages, 7 figures