中文

数据稀缺环境下的论证挖掘:跨语言迁移与少样本技术

计算与语言 2024-07-30 v1 人工智能

摘要

近期研究在序列标注任务中探索了多种策略,以缓解大多数世界语言缺乏人工标注数据的问题。其中最成功的做法基于 (i) 多语言预训练语言模型的跨语言迁移能力(模型迁移)、(ii) 数据翻译与标签投影(数据迁移)以及 (iii) 通过复用掩码目标进行的基于提示的学习,以发挥预训练语言模型的少样本能力(少样本)。以往研究似乎得出结论:模型迁移优于数据迁移方法,而基于提示的少样本技术优于通过微调更新模型权重。本文经验性地证明,对于论证挖掘——一种需要检测长复杂话语结构的序列标注任务——先前关于跨语言迁移或少样本学习的见解并不适用。与以往研究相反,我们展示在论证挖掘中,数据迁移优于模型迁移,而微调优于少样本方法。就前者而言,数据迁移所用数据集的领域似乎是决定性因素;就后者而言,任务类型(序列跨度的长度和复杂度)和采样方法至关重要。

关键词

引用

@article{arxiv.2407.03748,
  title  = {Argument Mining in Data Scarce Settings: Cross-lingual Transfer and Few-shot Techniques},
  author = {Anar Yeginbergen and Maite Oronoz and Rodrigo Agerri},
  journal= {arXiv preprint arXiv:2407.03748},
  year   = {2024}
}