中文

米其伦 (Michelangelo):通过潜在结构查询超越 haystack 的长上下文评估

计算与语言 2024-09-23 v2 机器学习

摘要

我们介绍了米其伦(Michelangelo):一个最小化、合成且未泄露的长上下文推理评估基准,适用于大型语言模型,同时易于自动评分。该评估通过一种新型统一框架构建而来,用于对任意长上下文环境进行评估,衡量模型是否能够从上下文中检索出多个信息片段。潜在结构查询框架(LSQ)的核心思想是构建需要模型“雕刻”掉上下文中无关信息以揭示潜在结构的任务。为验证模型对该潜在结构的理解, 我们查询模型以获取该结构的细节。利用LSQ,我们产生了三个诊断性长上下文评估,涵盖代码和自然语言领域,旨在提供更强的长上下文语言模型能力信号。我们对几种最先进的模型进行了评估,结果表明:a)所提出的评估具有高信噪比, b)合成长上下文信息还有显著提升空间。

关键词

引用

@article{arxiv.2409.12640,
  title  = {Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries},
  author = {Kiran Vodrahalli and Santiago Ontanon and Nilesh Tripuraneni and Kelvin Xu and Sanil Jain and Rakesh Shivanna and Jeffrey Hui and Nishanth Dikkala and Mehran Kazemi and Bahare Fatemi and Rohan Anil and Ethan Dyer and Siamak Shakeri and Roopali Vij and Harsh Mehta and Vinay Ramasesh and Quoc Le and Ed Chi and Yifeng Lu and Orhan Firat and Angeliki Lazaridou and Jean-Baptiste Lespiau and Nithya Attaluri and Kate Olszewska},
  journal= {arXiv preprint arXiv:2409.12640},
  year   = {2024}
}