标签函数的结构化探索与利用:用于自动数据标注的 EXPONA 框架
机器学习
2026-04-13 v1 人工智能
摘要
高质量的标记数据对训练可靠的机器学习和深度学习模型至关重要,但手动标注仍然昂贵且容易出错。程序化标注通过使用标签函数(LF)——即自动为训练数据集生成弱标签的启发式规则来解决此挑战。然而,现有的自动 LF 生成方法要么依赖大型语言模型(LLM)来合成表面级启发式,要么使用基于模型的合成方法,针对手工制作的原始素材进行操作。这些方法常常导致覆盖范围有限且标签质量不可靠。本文提出了 EXPONA,一款用于程序化标注的自动框架,将 LF 生成表述为一种原则化的过程,在多样性和可靠性之间进行权衡。EXPONA 系统性地探索多层级 LF,涵盖表面、结构和语义视角。EXPONA 进一步应用可靠性感知机制以抑制噪声或冗余启发式,同时保留互补信号。为评估 EXPONA,我们在跨越多个领域的十一个分类数据集上进行了大量实验。实验结果显示,EXPONA 持续优于最先进的自动 LF 生成方法。具体而言,EXPONA 实现了近乎完整的标签覆盖率(最高达 98.9%),将弱标签质量提高了最高 87%,并在加权 F1 分数上实现了最高 46% 的下游性能提升。这些结果表明,EXPONA 在生成 LF 集合中在覆盖率和精度之间进行权衡,结合了多层级 LF 探索和可靠性感知过滤,使其在跨任务场景下实现了更一致的标签质量和下游性能。
引用
@article{arxiv.2604.08578,
title = {Structured Exploration and Exploitation of Label Functions for Automated Data Annotation},
author = {Phong Lam and Ha-Linh Nguyen and Thu-Trang Nguyen and Son Nguyen and Hieu Dinh Vo},
journal= {arXiv preprint arXiv:2604.08578},
year = {2026}
}
备注
Accepted by KBS Journal