囊惑是否能反映大型语言模型在长文本理解中的能力
介观与纳米尺度物理
2024-05-13 v1
摘要
近期研究表明,大型语言模型(LLM)有潜力处理极长文本。许多工作仅在语言建模任务上评估 LLM 的长文本处理能力,并以囊惑(PPL)作为评估指标。然而,在本研究中,我们发现 PPL 与 LLM 的长文本理解能力之间不存在相关性。此外,PPL 可能仅反映模型对局部信息建模的能力,而非捕捉长程依赖。因此,仅用 PPL 来证明模型能够处理长文本是不恰当的。PPL 的局部关注特性也能解释一些既有现象,例如位置方法 ALiBi 的显著外推能力。当评估模型在长文本中的能力时,我们可能需要更关注 PPL 的局限性,避免过度依赖它。
引用
@article{arxiv.2405.06104,
title = {Fluorescent Graphene Quantum Dots-Enhanced Machine Learning for Accurate Detection and Quantification of Hg2+ and Fe3+ in Real Water Samples},
author = {Mauricio Llaver and Santiago Daniel Barrionuevo and Jorge Martín Nuñez and Agostina Chapana and Rodolfo G. Wuilloud and Myriam Haydee Aguirre and Francisco Javier Ibañez},
journal= {arXiv preprint arXiv:2405.06104},
year = {2024}
}