LongAttn:基于 Token 级注意力选择长上下文训练数据
计算与语言
2025-02-28 v2
摘要
随着大语言模型的发展,对处理长上下文的显著进步的需求日益增加。为了增强长上下文能力,构建具有长程依赖的高质量训练数据至关重要。现有的长上下文数据选择方法通常依赖于句子级分析,这在性能和效率上都有很大的优化空间。在本文中,我们提出了一种新颖的 token 级框架 LongAttn,它利用 LLM 的自注意力机制来衡量数据的长程依赖。通过计算 token 级依赖强度和 token 分数的分布均匀性,LongAttn 有效地量化了长程依赖,从而实现更准确、更高效的数据选择。我们从开源长上下文数据集中筛选出 LongABC-32K。通过全面的实验,LongAttn 展示了其出色的有效性、可扩展性和效率。为了促进长上下文数据的未来研究,我们发布了我们的代码和高质量长上下文训练数据 LongABC-32K。
引用
@article{arxiv.2502.16860,
title = {LongAttn: Selecting Long-context Training Data via Token-level Attention},
author = {Longyun Wu and Dawei Zhu and Guangxiang Zhao and Zhuocheng Yu and Junfeng Ran and Xiangyu Wong and Lin Sun and Sujian Li},
journal= {arXiv preprint arXiv:2502.16860},
year = {2025}
}
备注
17 pages, 5 figures