从懒到繁:基于正-未标记序列学习解决开词表极端分类中的缺失标签问题
信息检索
2025-01-10 v3 计算与语言
摘要
开词表极端多标签分类 (OXMC) 扩展了传统 XMC,允许预测超出极大预定义标签集(通常为 到 个标签)范围,以应对实际标签任务的动态性质。然而,数据标注中的自选择偏差导致训练和测试数据中存在显著缺失标签,尤其是针对较不受欢迎的输入。这两个关键挑战:生成模型学习过于 "懒",低于生成标签,以及由于测试集中注释不足而使评估变得不可靠。在本工作中,我们引入正-未标记序列学习 (PUSL),将 OXMC 重塑为无限关键词生成任务,以解决生成模型的懒惰问题。此外,我们提出采用一套评估指标, F1@ 和新提出的 B@, 可靠评估具有不完整真实值的 OXMC 模型。在一个不平衡的电子商务数据集中,PUSL 生成的唯一标签数增加了 30%,其 72% 的预测与实际用户查询相吻合。在较不偏斜的 EURLex-4.3k 数据集上,PUSL 在标签数从 15 增加至 30 时表现出更优的 F1 分数。 our 方法有效解决了 OXMC 中缺失标签的建模和评估挑战。
引用
@article{arxiv.2408.08981,
title = {From Lazy to Prolific: Tackling Missing Labels in Open Vocabulary Extreme Classification by Positive-Unlabeled Sequence Learning},
author = {Ranran Haoran Zhang and Bensu Uçar and Soumik Dey and Hansi Wu and Binbin Li and Rui Zhang},
journal= {arXiv preprint arXiv:2408.08981},
year = {2025}
}