SCOUT:面向长文本理解的主动信息觅食与解耦认知状态
计算与语言
2026-05-07 v1
摘要
百万 token 规模的长文本理解(LTU)需要在推理保真度与计算效率之间取得平衡。前沿的长上下文 LLM 可以端到端处理数百万 token 的上下文,但它们面临高 token 消耗和注意力稀释的问题。与此同时,专门的 LTU 智能体通常通过图构建或索引等任务无关的抽象牺牲了保真度。我们为 LTU 确定了一个关键洞察:相对于完整文档,与查询相关的信息通常是稀疏的,因此有效的推理应依赖于查询充分的子集,而非整个上下文。为了解决这个问题,我们提出了 SCOUT,一种将被动处理转变为主动信息觅食的 LTU 新范式。它将文档视为可探索的环境,并从紧凑的、基于来源的认知状态中给出答案。在状态级别的差距诊断指导下,SCOUT 自适应地在由粗到细的探索和锚定状态更新之间交替,逐步将其认知状态收缩至满足查询。实验表明,SCOUT 匹配了最先进的专有模型,同时将 token 消耗减少了多达 8 倍。此外,SCOUT 在上下文长度扩展时保持稳定,大幅缓解了实际中的成本-性能权衡。
引用
@article{arxiv.2605.04496,
title = {SCOUT: Active Information Foraging for Long-Text Understanding with Decoupled Epistemic States},
author = {Zhenliang Zhang and Wenqing Wang and Yong Hu and Yaming Yang and Jiaheng Gao and Chen Shen and Xiaojun Wan},
journal= {arXiv preprint arXiv:2605.04496},
year = {2026}
}
备注
ICML 2026