中文

用于作者画像的零样本与少样本学习

计算与语言 2022-05-18 v2

摘要

作者画像通过分析人们之间语言的共享方式来对作者特征进行分类。在本工作中,我们从小样本资源视角研究该任务:使用很少或没有训练数据。我们探索了基于蕴含关系的不同零样本与少样本模型,并在西班牙语和英语的若干画像任务上评估了我们的系统。此外,我们研究了蕴含假设与少样本训练样本规模的影响。我们发现基于蕴含的模型优于基于 roberta-XLM 的监督文本分类器,并且平均使用少于 50% 的训练数据即可达到先前方法准确率的 80%。

关键词

引用

@article{arxiv.2204.10543,
  title  = {Zero and Few-shot Learning for Author Profiling},
  author = {Mara Chinea-Rios and Thomas Müller and Gretel Liz De la Peña Sarracén and Francisco Rangel and Marc Franco-Salvador},
  journal= {arXiv preprint arXiv:2204.10543},
  year   = {2022}
}