中文

Koala:一种量化与预训练语料重叠度的索引

计算与语言 2023-03-28 v1 机器学习

摘要

近年来,人们愈发关注探究预训练数据在大型语言模型(LLMs)下游行为中的作用。尽管十分重要,目前尚无支持大规模预训练语料此类分析的公开工具。为助力该领域研究,我们推出了 Koala,一种基于压缩后缀数组、具有极高压缩率和搜索支持的可搜索预训练语料索引。在首次发布中,我们索引了 OPT 175B 预训练数据的公开部分。Koala 提供了一个框架,用于对当前及未来基准进行测试分析,并评估 LLM 输出中的记忆程度。Koala 已公开可用:https://koala-index.erc.monash.edu/。

关键词

引用

@article{arxiv.2303.14770,
  title  = {Koala: An Index for Quantifying Overlaps with Pre-training Corpora},
  author = {Thuy-Trang Vu and Xuanli He and Gholamreza Haffari and Ehsan Shareghi},
  journal= {arXiv preprint arXiv:2303.14770},
  year   = {2023}
}

备注

Available here: https://koala-index.erc.monash.edu/