过滤而非混合:基于随机滤波的在线门控混合大型语言模型
机器学习
2025-02-24 v2 人工智能
计算与语言
计算金融
数理金融
摘要
我们提出 MoE-F - 一个用于通过自适应预测每个时间步骤中大型语言模型(LLM)最佳权重来组合 N 个预训练 LLM 的在线时间序列预测的正式化机制。我们的机制利用每个专家运行绩效中的条件信息,预测其在下一步骤中预测时间序列的最佳组合。与静态(学习型)混合专家(MoE)方法不同,我们的方法采用时间自适应随机滤波技术来组合专家。通过将专家选择问题建模为有限状态空间、连续时间隐藏马尔可夫模型(HMM),我们可以利用 Wohman-Shiryaev 滤波器。我们的方法首先为每个独立的 LLM 构建 N 个平行滤波器。每个滤波器根据其可获得的信息提出其最佳 LLM 组合。随后,对 N 个滤波器输出进行最优聚合,以最大化其鲁棒预测能力,该更新通过闭式表达式高效计算,从而生成我们的集合预测器。我们的贡献包括:**(I)** MoE-F 插件式滤波 harness 算法,**(II)** 基于其并行贝叶斯滤波及其鲁棒聚合步骤的 proposed filtering-based gating algorithm 的理论最优性保证,**(III)** 使用最新基础模型和 MoE LLM 在真实世界金融市场走势预测任务中的经验评估和消融结果,其中 MoE-F 在预测基于流媒体新闻的短期市场走势时,相对于下一个表现最佳的单个 LLM 专家实现了显著的 17% 绝对和 48.5% 相对 F1 分数提升。进一步,我们在长期时间序列预测领域提供了将 MoE-F 应用于专用模型的显著性能提升的经验证据。
引用
@article{arxiv.2406.02969,
title = {Filtered not Mixed: Stochastic Filtering-Based Online Gating for Mixture of Large Language Models},
author = {Raeid Saqur and Anastasis Kratsios and Florian Krach and Yannick Limmer and Jacob-Junqi Tian and John Willes and Blanka Horvath and Frank Rudzicz},
journal= {arXiv preprint arXiv:2406.02969},
year = {2025}
}
备注
33 pages, 5 Appendix sections