从容量到价值:面向端侧 RAG 的偏好对齐记忆构建
计算与语言
2026-05-19 v1 人工智能
信息检索
机器学习
摘要
随着基于大型语言模型(LLM)的个人 AI 代理快速涌现,将其部署在端侧对于隐私保护和响应速度至关重要。为了处理现实请求中固有的个人化与上下文依赖特性,此类代理必须基于驻留在设备上的个人上下文来生成内容。然而,在严格的内存预算下,核心瓶颈在于存储什么内容才能使检索保持与用户偏好对齐。我们提出了 EPIC(Efficient Preference-aligned Index Construction,高效偏好对齐索引构建),该方法以用户偏好作为一种紧凑且稳定的个人上下文形式,并将其整合到整个 RAG 流水线中。EPIC 从原始数据中选择性地保留与偏好相关的信息,并将检索对齐到偏好匹配的上下文。在涵盖对话、辩论、解释和推荐的四个基准测试中,与性能最佳的基线相比,EPIC 将索引内存降低了 2,404 倍,将偏好遵循准确率提高了 20.17 个百分点,并将检索延迟降低了 33.33 倍。在端侧实验中,EPIC 在流式更新期间将内存占用保持在 1 MB 以下,查询延迟为 29.35 ms/query。
引用
@article{arxiv.2605.18271,
title = {From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG},
author = {Changmin Lee and Jaemin Kim and Taesik Gong},
journal= {arXiv preprint arXiv:2605.18271},
year = {2026}
}
备注
Accepted to ICML 2026. Code and data are available at https://github.com/UbiquitousAILab/EPIC