中文

基于链式结构思维与微型语言模型的长文档问答

计算与语言 2026-04-01 v1 人工智能 机器学习

摘要

大型语言模型(LLMs)广泛应用于文档数据分析,但直接对长篇噪声文档进行推理仍然脆弱且易出错。因此,我们研究将分散证据整合为结构化输出(如表格、图表或块)以支持可靠、可验证问答的文档问答问题。我们提出了一个两支柱框架 LiteCoST,以实现高准确率和低延迟。支柱 1:链式结构思维(Chain-of-Structured-Thought, CoST)。我们引入 CoST 模板,这是一种感知 schema 的指令,引导强大 LLM 生成逐步的 CoST 轨迹及相应的结构化输出。该过程诱导最小化结构、规范化实体/单位、对齐记录、序列化输出并验证/精炼,从而产生可审计的监督信号。支柱 2:微型语言模型微调。紧凑模型在两个阶段上进行训练:首先进行监督式微调以实现结构对齐,其次采用组相对策略优化(Group Relative Policy Optimization, GRPO)引入三重奖励以提高答案/格式质量和过程一致性。通过将结构化行为蒸馏到微型语言模型,本方法在 3B/7B 参数的 SLMs 上实现了与 LLM 相当的质量,同时比 GPT-4o 和 DeepSeek-R1(671B)延迟降低 2-4 倍。代码已公开于 https://github.com/HKUSTDial/LiteCoST。

关键词

引用

@article{arxiv.2603.29232,
  title  = {Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs},
  author = {Zhuowen Liang and Xiaotian Lin and Zhengxuan Zhang and Yuyu Luo and Haixun Wang and Nan Tang},
  journal= {arXiv preprint arXiv:2603.29232},
  year   = {2026}
}

备注

26 pages, 17 figures, 10 tables. Accepted at ICLR 2026