基于人类标注差异的训练与评估:一项实证研究
机器学习
2025-10-14 v5 计算与语言
摘要
人类标注差异(HLV)挑战了带标签实例具有单一真实值的标准假设,转而拥抱人类标注中的自然差异来训练和评估模型。尽管已经提出了多种针对HLV的训练方法和评估指标,但在何种设置下哪些方法和指标表现最佳仍不清楚。我们利用模糊集理论提出了新的HLV评估指标。由于这些新提出的指标是可微的,我们进而尝试将这些指标用作训练目标进行实验。我们在6个HLV数据集上进行了广泛的研究,测试了14种训练方法和6种评估指标。我们发现,使用分解标注或软标签进行训练在所有指标上表现最佳,优于使用所提出的可微指标作为训练目标的训练方法。我们还表明,我们提出的软微F1分数是HLV数据的最佳评估指标之一。
引用
@article{arxiv.2502.01891,
title = {Training and Evaluating with Human Label Variation: An Empirical Study},
author = {Kemal Kurniawan and Meladel Mistica and Timothy Baldwin and Jey Han Lau},
journal= {arXiv preprint arXiv:2502.01891},
year = {2025}
}
备注
27 pages, 7 figures. Accepted to CL. Pre-MIT Press publication version. Fixed PO-JSD values on the MFRC dataset. Completely redid the empirical meta-evaluation, added more related work, and other minor edits