用户概率数字孪生:基于统计验证语义的潜在表示学习
机器学习
2025-12-23 v1 社会与信息网络
摘要
理解用户身份和行为是个性化、推荐和决策支持等应用的核心任务。现有大多数方法依赖于确定性嵌入或黑箱预测模型,难以量化不确定性,亦缺乏对潜在表示所编码内容的洞察。我们提出一种概率数字孪生框架,其中将每个用户建模为生成观察行为数据的潜在随机状态。通过 amortize 变分推断学习数字孪生,既实现可扩展的后验估计,又保留完全的概率解释。我们采用变分自编码器(VAE)应用于用户响应数据集,以捕获用户身份的稳定方面。除标准的重建评估外,我们引入统计上严谨的解释管道,将潜在维度与可观测行为模式关联。通过分析每个潜在维度极端的用户,并利用非参数假设检验和效应大小进行验证,我们展示特定维度对应可解释特征,如意见强度和果断性。经验上,我们发现用户结构主要是连续的而非离散聚类,沿少数主导潜在轴线存在弱但有意义的结构。这些结果表明,概率数字孪生能够提供超越确定性用户嵌入的可解释、具不确定性感知的表示。
引用
@article{arxiv.2512.18056,
title = {Probabilistic Digital Twins of Users: Latent Representation Learning with Statistically Validated Semantics},
author = {Daniel David},
journal= {arXiv preprint arXiv:2512.18056},
year = {2025}
}
备注
11 pages, 10 figures. Methodological paper on probabilistic user modeling and latent representation learning