检索还是整体理解?Dolce:区分我们长上下文评估任务
计算与语言
2024-09-11 v1
摘要
我们认为在长上下文理解中存在两种主要不同的能力:检索和整体理解。在不了解任务侧重点的情况下,无法实现对 LLMs 长上下文能力的理解与提升。本文旨在自动识别评估基准中检索侧重型问题与整体理解侧重型问题,并在每类问题中定量衡量难度。本文提出了 Dolce 框架,该框架以 (复杂度)和 (冗余度)对每个问题进行参数化,并将其分配到五个预定义侧重类别中。我们提出从完整上下文中抽取短语上下文,并估计 LLM 使用抽取的片段解决问题的概率。为确定每个问题的 和 ,我们进一步提出一种混合模型,其包含非参数背景噪声成分和参数/非参数混合 oracle 成分,推导了在正确-错误(COW)情景和部分得分-grading(PIG)情景下,由 和 参数化的概率函数。我们的方法可识别 44 个现有长上下文评估任务中 0%至 67%的问题为检索侧重型,0%至 90%的问题为整体理解侧重型。
引用
@article{arxiv.2409.06338,
title = {Retrieval Or Holistic Understanding? Dolce: Differentiate Our Long Context Evaluation Tasks},
author = {Zi Yang},
journal= {arXiv preprint arXiv:2409.06338},
year = {2024}
}