CLIPPER:压缩实现长上下文合成数据生成
计算与语言
2025-08-06 v2
摘要
LLM 开发者正越来越依赖合成数据,但为复杂的长上下文推理任务生成高质�数据仍具有挑战性。我们介绍 CLIPPER,这是一种基于压缩的方法,用于生成针对叙事主张验证任务的合成数据。该任务需要对书籍进行推理以验证给定的主张。与直接从书籍原始文本生成主张(结果为充满瑕疵的主张)不同,CLIPPER 首先将书籍压缩为章节概览和书籍摘要,然后使用这些中间表示生成复杂主张及其对应的链式思考。与直接方法相比,CLIPPER 生成的主张更有效、更可靠且更复杂。使用 CLIPPER,我们构建了一个包含 19K 条合成书籍主张及其来源文本和链式思考reasoning的数据集,并用于微调三个开源模型。我们的最佳模型在叙事主张验证任务上取得突破性成果(测试集准确率从 28% 提升至 76%),并在 NoCha 排行榜上为参数不足 10B 的模型树立了新的 SOTA。进一步分析显示,我们的模型在生成更详细且更可靠的链式思考reasoning方面表现更佳,同时在其他叙事理解任务(例如 NarrativeQA)上也取得了改进。
引用
@article{arxiv.2502.14854,
title = {CLIPPER: Compression enables long-context synthetic data generation},
author = {Chau Minh Pham and Yapei Chang and Mohit Iyyer},
journal= {arXiv preprint arXiv:2502.14854},
year = {2025}
}
备注
Accepted to COLM 2025