Mixture of In-Context Experts 增强 LLMs 的长上下文感知能力
计算与语言
2024-10-18 v2
摘要
许多研究揭示了大语言模型 (LLM) 在不同上下文位置上的感知能力不均衡。其有限的上下文感知能力可能导致忽视关键信息,从而引发任务失败。虽然已提出了几种方法来增强 LLMs 的上下文感知能力,但在有效性和效率之间取得平衡仍然具有挑战性。本文提出了一种新方法,称为 "Mixture of In-Context Experts" (MoICE),用于解决上述挑战。MoICE 包含两个关键组件:集成于 LLMs 中每个注意力头的路由器,以及一种轻量级仅训练路由器的优化策略:(1) MoICE 将每个 RoPE 角度视为一个"在上下文中"的专家,已证明能够引导注意力头聚焦于特定的上下文位置。因此,每个注意力头都可以通过由路由器动态选择的多个 RoPE 角度来灵活处理 token,以便关注所需位置。这种方法缓解了忽视关键上下文信息的风险。(2) 仅路由器训练策略包括冻结 LLM 参数并仅更新几个步骤中的路由器。当应用于 Llama 和 Mistral 等开源 LLMs 时,MoICE 在多个长上下文理解和生成任务上均优于先前方法,同时保持了令人满意的推理效率。
引用
@article{arxiv.2406.19598,
title = {Mixture of In-Context Experts Enhance LLMs' Long Context Awareness},
author = {Hongzhan Lin and Ang Lv and Yuhan Chen and Chen Zhu and Yang Song and Hengshu Zhu and Rui Yan},
journal= {arXiv preprint arXiv:2406.19598},
year = {2024}
}
备注
Accepted by Neurips2024