中文

利用大型语言模型生成智能家居合成用户行为序列

人工智能 2025-02-03 v1 机器学习 网络与互联网体系结构

摘要

近年来,随着智能家居系统的日益普及,这些环境内的安全问题已成为日益增长的威胁。目前,大多数智能家居安全解决方案(如异常检测和行为预测模型)都是使用预先收集的固定数据集进行训练的。然而,数据集收集过程耗时且缺乏适应不断演变的智能家居环境所需的灵活性。此外,个人数据的收集引发了用户对隐私的严重担忧。近来,大型语言模型(LLMs)凭借其在自然语言处理、推理和解决问题方面的强大能力,已成为跨多种应用领域各类任务的强大工具。在本文中,我们提出了一个基于 LLM 的合成数据集生成框架 IoTGen,以增强下游智能家居智能模型的泛化能力。通过生成反映环境变化的新合成数据集,可以对智能家居智能模型进行重新训练,以克服固定和过时数据的局限性,使其更好地适应真实家庭环境的动态特性。具体而言,我们首先提出了一种专为物联网行为数据定制的结构模式感知压缩(SPPC)方法,该方法在显著减少 token 消耗的同时保留了数据中信息量最大的内容。然后,我们提出了一种系统化的方法来创建提示并实施数据生成,以自动生成具有规范和合理属性的物联网合成数据,从而辅助任务模型进行自适应训练,以提高泛化能力和真实世界性能。

关键词

引用

@article{arxiv.2501.19298,
  title  = {Synthetic User Behavior Sequence Generation with Large Language Models for Smart Homes},
  author = {Zhiyao Xu and Dan Zhao and Qingsong Zou and Jingyu Xiao and Yong Jiang and Zhenhui Yuan and Qing Li},
  journal= {arXiv preprint arXiv:2501.19298},
  year   = {2025}
}