面向 AI 辅助编码的 Context-Aware CodeLLM 驱逐策略
软件工程
2025-06-24 v1
摘要
由 Code 大型语言模型(CodeLLM)驱动的 AI 辅助编码工具日益集成到现代软件开发工作流程中。为解决关于隐私、延迟和模型定制的顾虑,许多企业选择自托管这些模型。然而,CodeLLM 的多样性和日益增长的数量,结合加速器内存的有限,带来了模型管理和服务效率的实际挑战。本文提出了 CACE(Context-Aware CodeLLM Eviction,即面向自托管 CodeLLM 的 Context-Aware 模型驱逐策略),这是一种专为在资源受限环境下优化自托管 CodeLLM 服务而设计的新型 Context-Aware 模型驱逐策略。与基于仅仅最近使用情况(例如最近最少使用策略)的传统驱逐策略不同,CACE 利用包括模型加载时间、任务特定的延迟敏感性、预期输出长度,以及通过滑动窗口跟踪的近期使用和未来需求等多种 Context-Aware 因素。我们使用包括延迟敏感的代码完成和吞吐量密集型代码推理任务等现实工作负载来评估 CACE。我们的实验显示,CACE 降低了时间到第一个标记(Time-to-First-Token, TTFT)和端到端(end-to-end, E2E)延迟,同时显著降低了模型驱逐的次数。消融研究进一步证明了多因素驱逐在平衡响应速度和资源效率方面的重要性。本工作为在现实软件工程环境中部署可扩展、低延迟的 AI 编码助手提供了实用策略。
引用
@article{arxiv.2506.18796,
title = {Context-Aware CodeLLM Eviction for AI-assisted Coding},
author = {Kishanthan Thangarajah and Boyuan Chen and Shi Chang and Ahmed E. Hassan},
journal= {arXiv preprint arXiv:2506.18796},
year = {2025}
}
备注
12 pages, 6 figures