中文

面向书籍级上下文的多层级 LLM 理解的全自动化评估框架

计算与语言 2025-08-28 v1 人工智能

摘要

我们提出 HAMLET,一个面向书籍级上下文的大语言模型(LLM)长上下文理解的全自动化评估框架。HAMLET 将源文本组织为根节点、分支节点和叶节点三级关键事实层次结构,并采用查询导向的摘要方法来评估模型在各层级上回忆和忠实表征信息的能力。为验证全自动化流水线的可靠性,我们开展了系统性人工实验,结果表明自动评估与专家人工判断的一致性超过 90%,同时成本降低了多达 25 倍。HAMLET 揭示了 LLM 在细粒度理解方面存在困难,尤其是在叶节点层,并且对中间丢失(lost-in-the-middle)等位置效应敏感。分析性查询比叙述性查询更具挑战性,开源模型与专有模型之间以及不同模型规模之间出现了持续的性能差距。代码和数据集公开获取于 https://github.com/DISL-Lab/HAMLET。

关键词

引用

@article{arxiv.2508.19578,
  title  = {Towards a Holistic and Automated Evaluation Framework for Multi-Level Comprehension of LLMs in Book-Length Contexts},
  author = {Jiaqi Deng and Yuho Lee and Nicole Hee-Yeon Kim and Hyangsuk Min and Taewon Yun and Minjeong Ban and Kim Yul and Hwanjun Song},
  journal= {arXiv preprint arXiv:2508.19578},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Main)