收益来源:条件平均剂量反应估计中的性能分解
软件工程
2024-09-05 v2 机器学习
摘要
估计条件平均剂量反应(CADR)是一个重要但具有挑战性的问题。估计器必须正确地建模关于协变量、干预、剂量和结果之间可能复杂的关系。近年来,机器学习社区对开发针对特定挑战的定制 CADR 估计器表现出浓厚兴趣。这些方法通常在(半)合成基准数据集上与其他方法进行评估。我们的论文分析了这种做法,表明在没有进一步分析的情况下使用流行基准数据集不足以判断模型性能。已建立的基准涉及多个挑战,必须将其影响分解。因此,我们提出了一种新颖的分解方案,允许对五个不同组成部分对 CADR 估计器性能贡献的影响进行评估。我们将该方案应用于八种流行的 CADR 估计器和四个广泛使用的数据集,进行近 1500 项独立实验。我们的结果揭示了大多数已建立的基准与其创建者声称的挑战不同。值得注意的是,混杂效应是大多数估计器所针对的关键挑战,在所考虑的数据集中并非问题。我们讨论了这些发现的主要含义,并提出未来研究的方向。
引用
@article{arxiv.2406.08205,
title = {What do we know about Hugging Face? A systematic literature review and quantitative validation of qualitative claims},
author = {Jason Jones and Wenxin Jiang and Nicholas Synovic and George K. Thiruvathukal and James C. Davis},
journal= {arXiv preprint arXiv:2406.08205},
year = {2024}
}
备注
[ESEM'24] Proceedings of the 18th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM) 2024