中文

评估LLP方法:挑战与对策

机器学习 2023-10-31 v1

摘要

从标签比例学习(Learning from Label Proportions, LLP)是一个成熟的机器学习问题,具有众多现实应用。在该设定下,数据项被分组为包(bag),目标是在仅知数据特征与每包中标签比例的情况下学习个体数据项标签。尽管LLP是一个成熟问题,它仍具有若干非同寻常的方面,给学习方法的基准测试带来挑战。由于存在不同的LLP变体(即数据项、标签与包之间可能存在的依赖结构),由此产生了根本性困难。相应地,第一个算法挑战是生成捕捉依赖结构与包特征多样性的变体特定数据集。第二个方法学挑战是模型选择,即超参数调优;由于LLP的性质,模型选择无法轻易使用标准机器学习范式。最后的基准测试挑战在于跨不同LLP变体恰当地评估LLP求解方法。我们注意到,先前工作对这些问题的考量极少,且迄今未提出针对这些挑战的通用解决方案。为应对这些挑战,我们开发了能够生成满足不同变体要求之LLP数据集的方法。我们利用这些方法生成了一套涵盖LLP问题特征谱系的数据集集合,可供未来评估研究使用。此外,我们制定了LLP算法基准测试的指南,包括模型选择与评估步骤。最后,我们通过一组知名LLP算法的广泛基准测试来阐释新方法与指南。我们表明,最佳算法的选择关键取决于LLP变体与模型选择方法,这证明了我们所提方法的必要性。

关键词

引用

@article{arxiv.2310.19065,
  title  = {Evaluating LLP Methods: Challenges and Approaches},
  author = {Gabriel Franco and Giovanni Comarela and Mark Crovella},
  journal= {arXiv preprint arXiv:2310.19065},
  year   = {2023}
}