中文

如何构建有效的长上下文多跳指令数据集?洞见与最佳实践

计算与语言 2025-05-20 v2 人工智能

摘要

近期大型语言模型 (LLM) 具备扩展上下文窗口的进展显著提升了信息抽取、问答及复杂规划等任务。为提升长上下文任务性能,大量工作通过合成数据增强模型的长上下文能力。现有方法通常采用 Self-Instruct 框架生成指令调优数据,但我们的初步实验表明,少于 35% 的生成样本为多跳样本,且超过 40% 表现不佳,限制了综合理解与后续研究。为提升合成数据的质量,我们提出 Multi-agent Interactive Multi-hop Generation (MIMG) 框架,包含质量验证智能体、单跳问题生成智能体、多问题抽样策略及多跳问题合并智能体。该框架提升了数据质量,高质量、多跳且多样化的数据比例超过 85%。进一步通过大量实验系统性地探讨文件选择、问题合并及验证策略。我们的发现表明,所生成的高质量长上下文指令数据显著提升模型性能,甚至超越基于更大人工标注数据训练的模型。我们的代码已公开:https://github.com/WowCZ/LongMIT。

关键词

引用

@article{arxiv.2409.01893,
  title  = {What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best Practices},
  author = {Zhi Chen and Qiguang Chen and Libo Qin and Qipeng Guo and Haijun Lv and Yicheng Zou and Wanxiang Che and Hang Yan and Kai Chen and Dahua Lin},
  journal= {arXiv preprint arXiv:2409.01893},
  year   = {2025}
}

备注

ACL 2025 Camera Ready. Code is available at: https://github.com/WowCZ/LongMIT