中文

太长了,不过模型也看不懂:基于新作小说分解大语言模型长程理解

计算与语言 2025-05-22 v1 人工智能 机器学习

摘要

尽管大语言模型(LLM)的上下文长度已提升至数百万 token,但评估其超越针对针灸法(needle-in-a-haystack)方法的实际效果仍显困难。我们认为新作小说是细致复杂结构及超128k token 长程语义依赖的典型案例。致力于计算小说分析,本文发布了太长了,不过模型也看不懂(Too Long, Didn't Model, TLDM)基准测试,检验模型报告情节概述、故事世界配置及叙事时间消逝情况的能力。我们发现,七款测试的前沿 LLM 在超过64k token 时均未保持稳定的理解能力。我们的结果表明,语言模型开发者在评估复杂长程情境下的模型表现时,必须超越“中间丢失”基准测试。为促进后续发展,我们随 TLDM 基准测试、参考代码及数据一同发布。

关键词

引用

@article{arxiv.2505.14925,
  title  = {Too Long, Didn't Model: Decomposing LLM Long-Context Understanding With Novels},
  author = {Sil Hamilton and Rebecca M. M. Hicke and Matthew Wilkens and David Mimno},
  journal= {arXiv preprint arXiv:2505.14925},
  year   = {2025}
}