CASTILLO:字符化大型语言模型响应长度分布
计算与语言
2025-05-23 v1 人工智能
摘要
有效管理大型语言模型(LLM)推理的计算资源 remains 挑战性,因为自回归文本生成本质上是随机的且长度不固定。准确估计响应长度有助于主动进行资源分配,但现有方法要么会偏向某些长度,要么依赖忽略模型和提示特定变异性的假设。我们提出CASTILLO(Characterizing Response Length Distributions of Large Language Models),一个描述13个广泛使用的开源LLM在七个不同指令跟随语料库上的响应长度分布的数据集。对于每个提示,模型样本对,我们使用固定的解码超参数生成10个独立的完成,记录每个响应的 token 长度,并发布概要统计信息(均值、标准差、百分位数),以及最短和最长的完成,以及确切的生成设置。我们的分析揭示了响应长度在不同模型之间以及同一模型内部的显著变异性(即使使用相同的生成设置),以及模型特定的行为以及仅在部分响应中出现的文本退化现象。CASTILLO使得开发预测模型以实现主动调度成为可能,提供了系统化框架来分析模型特定的生成行为。我们公开发布了数据集和代码,以促进生成式语言建模与系统研究之间的交叉领域的研究。
引用
@article{arxiv.2505.16881,
title = {CASTILLO: Characterizing Response Length Distributions of Large Language Models},
author = {Daniel F. Perez-Ramirez and Dejan Kostic and Magnus Boman},
journal= {arXiv preprint arXiv:2505.16881},
year = {2025}
}
备注
Dataset available in https://huggingface.co/datasets/danfperam/castillo and code is available in https://github.com/DanielFPerez/castillo