中文

ALDEN:基于强化学习的主动文档导航与证据收集框架

人工智能 2025-10-30 v1 多媒体

摘要

视觉语言模型 (VLM) 在解读富文本图像方面表现出色,但在处理需要跨多页分析和整合信息的长文档时表现不足。现有方法通常依赖固定的推理模板或僵化的管道,使 VLM 处于被动角色,限制了效率和泛化能力。我们提出主动长文档导航 (Active Long-DocumEnt Navigation, ALDEN),一个基于强化学习的多回合框架,对 VLM 进行微调,使其成为能够主动导航长文档、富视觉信息文档的交互式智能体。ALDEN 引入一种新型 fetch 操作,直接通过索引访问页面,补充经典的 search 操作,更好地利用文档结构。为实现密集过程监督和高效训练,我们提出了基于规则的跨层奖励机制,提供回合级和 token 级信号。为解决长文档大量视觉 token 导致的训练不稳定问题,我们进一步提出了视觉-语义锚定机制,应用双路径 KL 散度约束,分别稳定视觉和文本表示。在三个开源数据集构建的语料库上训练后,ALDEN 在五个长文档基准任务上实现了最先进的性能。总体而言,ALDEN 表示了从被动文档阅读向能够自主导航和跨长文档进行推理的智能体迈出的一步,为实现更准确、更高效的长文档理解提供了稳健的路径。

关键词

引用

@article{arxiv.2510.25668,
  title  = {ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents},
  author = {Tianyu Yang and Terry Ruas and Yijun Tian and Jan Philip Wahle and Daniel Kurzawe and Bela Gipp},
  journal= {arXiv preprint arXiv:2510.25668},
  year   = {2025}
}