中文

大语言模型作为用户日常行为数据生成器:平衡群体多样性与个体个性

机器学习 2025-05-26 v1 计算与语言 信息检索

摘要

预测人类日常行为具有挑战性,原因在于常规模式的复杂性和短期波动。虽然数据驱动模型通过利用来自各种平台和设备的经验数据改善了行为预测,但对敏感大规模用户数据的依赖引发了隐私问题并限制了数据可用性。合成数据生成已成为一个有前景的解决方案,尽管现有方法通常局限于特定应用。在本工作中,我们引入BehaviorGen,一个利用大语言模型(LLM)生成高质量合成行为数据的框架。BehaviorGen通过基于用户画像和真实事件模拟用户行为,支持行为预测模型中的数据增强和替换。我们在数据增强、微调替换和微调增强等场景中评估其性能,在人类移动性和智能手机使用预测方面取得显著提升,最高增益达18.9%。结果表明BehaviorGen通过灵活且保护隐私的合成数据生成,有望增强用户行为建模。

关键词

引用

@article{arxiv.2505.17615,
  title  = {Large language model as user daily behavior data generator: balancing population diversity and individual personality},
  author = {Haoxin Li and Jingtao Ding and Jiahui Gong and Yong Li},
  journal= {arXiv preprint arXiv:2505.17615},
  year   = {2025}
}

备注

14 pages, 7 figures, 4 tables