中文

用户概率数字孪生:基于统计验证语义的潜在表示学习

机器学习 2025-12-23 v1 社会与信息网络

摘要

理解用户身份和行为是个性化、推荐和决策支持等应用的核心任务。现有大多数方法依赖于确定性嵌入或黑箱预测模型,难以量化不确定性,亦缺乏对潜在表示所编码内容的洞察。我们提出一种概率数字孪生框架,其中将每个用户建模为生成观察行为数据的潜在随机状态。通过 amortize 变分推断学习数字孪生,既实现可扩展的后验估计,又保留完全的概率解释。我们采用变分自编码器(VAE)应用于用户响应数据集,以捕获用户身份的稳定方面。除标准的重建评估外,我们引入统计上严谨的解释管道,将潜在维度与可观测行为模式关联。通过分析每个潜在维度极端的用户,并利用非参数假设检验和效应大小进行验证,我们展示特定维度对应可解释特征,如意见强度和果断性。经验上,我们发现用户结构主要是连续的而非离散聚类,沿少数主导潜在轴线存在弱但有意义的结构。这些结果表明,概率数字孪生能够提供超越确定性用户嵌入的可解释、具不确定性感知的表示。

关键词

引用

@article{arxiv.2512.18056,
  title  = {Probabilistic Digital Twins of Users: Latent Representation Learning with Statistically Validated Semantics},
  author = {Daniel David},
  journal= {arXiv preprint arXiv:2512.18056},
  year   = {2025}
}

备注

11 pages, 10 figures. Methodological paper on probabilistic user modeling and latent representation learning