中文

面向 ML 嵌入式移动应用的用户行为日志存储优化

机器学习 2025-10-16 v1 网络与互联网体系结构

摘要

机器学习(ML)模型正日益集成到现代移动应用中,以实现面向个性化和智能服务。这些模型通常依赖于源自历史用户行为的丰富输入特征以捕获用户意图。然而,随着 ML 驱动服务的普及,记录必要的用户行为数据对移动应用构成了巨大的存储成本,导致系统响应性下降和更多应用被卸载。为此,我们提出了 AdaLog,一种轻量且自适应的系统,旨在提高 ML 嵌入式移动应用中用户行为日志的存储效率,而不会牺牲模型推理准确度或延迟。我们识别到了当前工业实践中用户行为日志的两个关键效率问题:(i)不同特征和模型之间重叠行为数据的冗余记录;(ii)存储稀疏化——将具有异构属性描述的行为数据存储在单个日志文件中。为解决这些问题,AdaLog 首先将特征层面的冗余数据消除问题形式化为超图中的最大加权匹配问题,并提出了一种高效的分层算法以适用于设备端部署。随后,AdaLog 采用虚拟哈希属性设计,将异构行为分布到少数几个日志文件中,以实现物理稠密存储。最终,为确保适应动态用户行为模式的可扩展性,AdaLog 设计了一种增量更新机制,以最小化适应过时用户行为日志所需的 I/O 操作。我们实现了一个 AdaLog 原型,并与行业合作伙伴一起在流行的移动应用中部署。针对真实世界的用户数据进行评估,显示 AdaLog 在最小系统开销(仅 2 秒延迟和 15 MB 内存占用)下,将行为日志大小降低 19% 到 44%,为更广泛地采用设备端 ML 提供了更高效的数据基础。

关键词

引用

@article{arxiv.2510.13405,
  title  = {Optimizing Storage Overhead of User Behavior Log for ML-embedded Mobile Apps},
  author = {Chen Gong and Yan Zhuang and Zhenzhe Zheng and Yiliu Chen and Sheng Wang and Fan Wu and Guihai Chen},
  journal= {arXiv preprint arXiv:2510.13405},
  year   = {2025}
}