中文

伪标签足矣

计算与语言 2022-08-22 v1

摘要

自动估计读者所需文本复杂度有诸多应用,例如向语言学习者推荐复杂度适当的文本,或支持对文本简化方法的评估。本文介绍我们向Text Complexity DE Challenge 2022提交的方案,该回归任务旨在预测德语学习者B级别德语句子的复杂度。我们的方法依赖于从德语维基百科及其他语料创建的超过220,000个伪标签来训练基于Transformer的模型,并且避免任何特征工程或任何额外的有标签数据。我们发现,基于伪标签的方法取得了令人印象深刻的成果,且几乎不需要针对特定任务进行调整,因此可轻易适配到其他领域与任务。

关键词

引用

@article{arxiv.2208.09243,
  title  = {Pseudo-Labels Are All You Need},
  author = {Bogdan Kostić and Mathis Lucka and Julian Risch},
  journal= {arXiv preprint arXiv:2208.09243},
  year   = {2022}
}

备注

KONVENS 2022