弱标注的准确性代价:时间事件固定分段弱标注的理论分析
机器学习
2025-09-30 v2
摘要
准确的标签对于构建稳健的机器学习模型至关重要。标签用于训练监督学习模型并评估大多数机器学习范式。在本文中,我们对一种常见的弱标注过程的准确性和成本进行了建模,在该过程中,标注者为给定事件类别分配固定长度数据段的“存在”或“不存在”标签。如果某段充分覆盖了该类的一个事件(例如,音频数据中的鸟鸣声事件),则标注者将该段标记为“存在”。我们分析了段长度如何影响标签准确性和所需的标注数量,并将这种固定长度标注方法与一种使用真实事件激活来构建段的oracle方法进行了比较。此外,我们量化了这些方法之间的差距,并验证了在大多数现实场景中,oracle方法在准确性和成本方面都优于固定长度标注方法。我们的发现为模拟oracle过程的自适应弱标注策略提供了理论依据,并为在序列标注任务中优化弱标注过程奠定了基础。
引用
@article{arxiv.2502.09363,
title = {The Accuracy Cost of Weakness: A Theoretical Analysis of Fixed-Segment Weak Labeling for Events in Time},
author = {John Martinsson and Tuomas Virtanen and Maria Sandsten and Olof Mogren},
journal= {arXiv preprint arXiv:2502.09363},
year = {2025}
}
备注
Published at TMLR