中文

生成式表示指令微调

计算与语言 2025-03-04 v3 人工智能 机器学习

摘要

所有基于文本的语言问题均可归约为生成或嵌入任务。当前模型通常仅在其中一项上表现良好。我们提出了生成式表示指令微调(GRIT),通过指令区分任务类型,训练大型语言模型同时处理生成和嵌入任务。与其他开源模型相比,我们的 GritLM 7B 在大规模文本嵌入基准(MTEB)上树立了新的最先进水平(SOTA),并在一系列生成任务中优于所有同等规模的模型。通过进一步扩展,GritLM 8x7B 优于我们测试的所有开源生成式语言模型,同时仍是最佳的嵌入模型之一。值得注意的是,我们发现 GRIT 的效果与仅针对生成或嵌入数据进行训练相当,因此我们可以统一两者而无性能损失。除其他优势外,通过 GRIT 实现的统一使长文档的检索增强生成(RAG)速度提升了 60% 以上,不再需要单独的检索和生成模型。模型、代码等资源可在 https://github.com/ContextualAI/gritlm 免费获取。

关键词

引用

@article{arxiv.2402.09906,
  title  = {Generative Representational Instruction Tuning},
  author = {Niklas Muennighoff and Hongjin Su and Liang Wang and Nan Yang and Furu Wei and Tao Yu and Amanpreet Singh and Douwe Kiela},
  journal= {arXiv preprint arXiv:2402.09906},
  year   = {2025}
}

备注

67 pages (16 main), 25 figures, 34 tables