基于标签比例学习的文本分类
机器学习
2023-10-19 v1
摘要
我们展示了在具有挑战性的标签比例学习(LLP)设定下早期的 NLP 工作之一,其中数据以称为袋(bag)的聚合形式提供,且仅以每个类中样本的比例为真实标签。该设定符合在隐私设置和弱监督下训练模型所期望的特性。通过刻画最广泛使用的基线技术 DLLP 的一些不规则性,我们提出了一种同样具有鲁棒性的新公式。这伴随一个可学习性结果,给出了 LLP 下的泛化界。将该公式与自监督目标结合,我们的方法在几乎 87% 的实验配置中取得了优于基线的结果,这些配置包含面向长短文本的大规模模型以及多种指标。
引用
@article{arxiv.2310.11707,
title = {Learning under Label Proportions for Text Classification},
author = {Jatin Chauhan and Xiaoxuan Wang and Wei Wang},
journal= {arXiv preprint arXiv:2310.11707},
year = {2023}
}
备注
accepted as long paper in Findings of EMNLP 2023