论 F 度量最大化器的贝叶斯最优性
机器学习
2015-03-09 v3 机器学习
摘要
F 度量最初引入于信息检索领域,如今已常规用作二元分类、多标签分类和结构化输出预测等问题的性能指标。优化该度量是一个在统计和计算上都具有挑战性的问题,因为不存在闭式解。本文采用决策论视角,对最大化 F 度量的不同方法进行了形式化和实验分析。我们首先对相关损失函数(如汉明损失和子集零一损失)进行贝叶斯风险分析,表明将优化此类损失作为 F 度量的替代会导致较高的最坏情况遗憾值。随后,我们对 F 度量最大化算法进行了类似的分析,表明此类算法是近似的,且依赖于关于二元响应变量统计分布的额外假设。此外,我们提出了一种新算法,该算法不仅计算高效,而且无论底层分布如何均具有贝叶斯最优性。为此,该算法仅需联合分布中与二元响应数量呈二次方关系的参数数量。我们通过多标签分类问题的实验,说明了所有被分析方法的实际性能。
引用
@article{arxiv.1310.4849,
title = {On the Bayes-optimality of F-measure maximizers},
author = {Willem Waegeman and Krzysztof Dembczynski and Arkadiusz Jachnik and Weiwei Cheng and Eyke Hullermeier},
journal= {arXiv preprint arXiv:1310.4849},
year = {2015}
}