两头不凡:通过特征分解与混合将大型语言模型特征蒸馏至小模型
人工智能
2026-01-30 v3
摘要
通过强化学习 (RL) 实现的市场制造 (MM) 在金融交易中引起广泛关注。随着大型语言模型 (LLM) 的发展,越来越多的尝试被用于金融领域。将 LLM 直接作为智能体的简单方法显示出显著的性能。但此类方法受限于推理速度慢,而目前的研究大多未针对此特定任务探讨 LLM 蒸馏问题。为此,我们首先提出归一化荧光探针来研究 LLM 特征的机制。基于我们的调查发现的观察,我们提出了合作市场制造 (CMM),这是一种新框架,通过解耦 LLM 特征在三个正交维度上的特征:层次、任务和数据。各种学生模型协同学习简单 LLM 特征,每个模型负责不同的维度特征,以实现知识蒸馏。此外,CMM 引入 H\'{a}jek-MoE,通过探讨在由核函数生成的公共特征空间中不同模型的贡献来整合学生模型的输出。在四个真实世界市场数据集上进行的大量实验结果表明,CMM 在当前蒸馏方法和基于 RL 的市场制造策略方面具有优势。
引用
@article{arxiv.2511.07110,
title = {Two Heads are Better than One: Distilling Large Language Model Features Into Small Models with Feature Decomposition and Mixture},
author = {Tianhao Fu and Xinxin Xu and Weichen Xu and Jue Chen and Ruilong Ren and Bowen Deng and Xinyu Zhao and Jian Cao and Xixin Cao},
journal= {arXiv preprint arXiv:2511.07110},
year = {2026}
}
备注
accepted by AAAI2026