不放大参数:高效长上下文训练紧凑 7B 语言模型
计算与语言
2025-05-14 v1 机器学习
摘要
我们提出了 MegaBeam-Mistral-7B,一种支持 512K token 长度的语言模型。我们的工作针对长上下文训练中的实际限制,支持诸如合规监控与核查等实际任务。在三个长上下文基准测试中评估,我们的 7B 参数模型在 HELMET 上的零样本学习性能卓越,并在 RULER 上的检索和追踪能力稳健。目前是唯一在 512K 上下文长度上实现 BABILong 上竞争性长程推理的开放模型,无需 RAG 或针对性微调。该模型以 Apache 2.0 许可证全球开放发布,已在 Hugging Face 上下载超过 10 万次。模型地址:https://huggingface.co/aws-prototyping/MegaBeam-Mistral-7B-512k
引用
@article{arxiv.2505.08651,
title = {Scaling Context, Not Parameters: Training a Compact 7B Language Model for Efficient Long-Context Processing},
author = {Chen Wu and Yin Song},
journal= {arXiv preprint arXiv:2505.08651},
year = {2025}
}
备注
8 pages, 6 figures, ACL 2025 (Industry Track)