超越纯推理部署:比较基于权重的整合与级联压缩
人工智能
2026-05-26 v1 软件工程
摘要
主流的大语言模型平台以纯推理配置部署模型:模型提供服务,但从不更新每个用户的权重。用户必须反复重新教授偏好、修正和项目上下文,而基于上下文的变通方法会消耗上下文窗口空间,并在级联压缩下性能下降。我们评估了一种替代方案:通过反思、合成和低秩适配(LoRA)微调,在单个消费级GPU上,将交互知识夜间整合到模型权重中。在十次真实的软件开发对话中(n = 10,跨三种记忆类型的1,146个测试问题),三轮级联压缩保留了36.8 ± 3.0%的知识(介于11.8%的无上下文下限和90.1%的全上下文上限之间),而整合保留了80.4 ± 1.3%——提升了43.6个百分点(配对t(9) = 14.8, p < 0.001),是压缩所保留知识的两倍多,其中在程序性修正(36.3% -> 74.6%)和情景性项目事实(31.5% -> 78.2%)上提升最大。作为方法论上的附带发现,平均每令牌验证交叉熵与大语言模型评判的准确性呈负相关(r = -0.51),而中位数每令牌验证交叉熵几乎完全跟踪准确性(r = +0.99):在容忍表面形式变化的评估器下,平均值具有误导性,而一个对重尾鲁棒的统计量才是可靠的信号。持久的个性化需要超越纯推理部署,转向将知识整合到权重中的架构。
引用
@article{arxiv.2605.24657,
title = {Beyond Inference-Only Deployment: Comparing Weight-Based Consolidation Against Cascading Compaction},
author = {Simon Dennis and Kevin Shabahang and Hao Guo and Rivaan Patil},
journal= {arXiv preprint arXiv:2605.24657},
year = {2026}
}
备注
15 pages