中文

基于标签比例学习的文本分类

机器学习 2023-10-19 v1

摘要

我们展示了在具有挑战性的标签比例学习(LLP)设定下早期的 NLP 工作之一,其中数据以称为袋(bag)的聚合形式提供,且仅以每个类中样本的比例为真实标签。该设定符合在隐私设置和弱监督下训练模型所期望的特性。通过刻画最广泛使用的基线技术 DLLP 的一些不规则性,我们提出了一种同样具有鲁棒性的新公式。这伴随一个可学习性结果,给出了 LLP 下的泛化界。将该公式与自监督目标结合,我们的方法在几乎 87% 的实验配置中取得了优于基线的结果,这些配置包含面向长短文本的大规模模型以及多种指标。

关键词

引用

@article{arxiv.2310.11707,
  title  = {Learning under Label Proportions for Text Classification},
  author = {Jatin Chauhan and Xiaoxuan Wang and Wei Wang},
  journal= {arXiv preprint arXiv:2310.11707},
  year   = {2023}
}

备注

accepted as long paper in Findings of EMNLP 2023