用于定义“与我相似者”的混合距离
统计方法学
2022-07-12 v1
摘要
曲线匹配是一种依赖于预测均值匹配的预测技术,该技术基于预测距离将最相似于目标的供体进行匹配。尽管这种方法能带来较高的预测精度,但预测距离可能使匹配看起来缺乏说服力,因为匹配供体的特征曲线可能与目标的特征曲线存在显著差异。为对此进行平衡,可将供体与目标的曲线之间的相似性考虑进来,通过将预测距离与马哈拉诺比斯距离结合为一种“混合距离”度量。该度量的性质在两项模拟研究中进行了评估。模拟研究 I 在不同数据生成条件下评估混合距离的性能。结果表明,向马哈拉诺比斯距离混合会导致在偏差、覆盖率和预测能力方面性能变差。模拟研究 II 在仅插补单个值的设定下评估该混合度量。结果表明,混合的一个特性是偏差-方差权衡。赋予马哈拉诺比斯距离更大权重会导致插补值方差更小,但精度也更低。主要结论是,预测距离所实现的高预测精度是以供体特征曲线的变异性为必要代价的。
引用
@article{arxiv.2207.04650,
title = {A blended distance to define "people-like-me"},
author = {Anaïs Fopma and Mingyang Cai and Stef van Buuren and Gerko Vink},
journal= {arXiv preprint arXiv:2207.04650},
year = {2022}
}