中文

大语言模型提示数据集:深入分析与洞察

机器学习 2026-05-08 v2 计算与语言

摘要

我们整理了 129 个异构大语言模型提示数据集(>1.22 TB,>6.73 亿条实例),构建了结构化分类法,并对七个代表性语料库进行了多层语言分析(词汇、句法和语义),揭示了区分提示与通用文本的系统性模式。三个下游实验验证了实际效用:提示过滤(F1 = 0.90)、领域分类(Macro-F1 = 0.975)和提示质量预测(AUC = 0.792),均无需调用任何额外模型。核心发现是,62 个句法特征(词性 + 依存分布)作为独特的路由基元,以 1.9 倍更低的单次请求延迟(3.0 ms vs. 5.7 ms)且无需 GPU 和语料库词汇即可恢复 93% 以上的 GPU 嵌入精度。互补的判别-预测分歧表明,对路由最有用的特征恰好与响应质量最负相关,而词汇多样性(Cohen's dd = 0.71)主导质量信号但携带的路由权重极小,直接启发了两阶段流水线设计。我们的数据集和代码可公开获取。

关键词

引用

@article{arxiv.2510.09316,
  title  = {Large Language Model Prompt Datasets: An In-depth Analysis and Insights},
  author = {Yuanming Zhang and Yan Lin and Arijit Khan and Huaiyu Wan},
  journal= {arXiv preprint arXiv:2510.09316},
  year   = {2026}
}