中文

Eeny, meeny, miny, moe. 如何为形态学屈折选择数据

计算与语言 2022-10-27 v1

摘要

在面向低资源语言的众多自然语言处理(NLP)任务中,数据稀缺是一个普遍存在的问题。在形态学领域,数据标注/加注的劳动密集型工作构成了 NLP 与语言记录的严重瓶颈。主动学习(AL)旨在通过选择对改进模型最具信息量的数据来降低数据标注成本。本文使用 Transformer 模型探索了形态学屈折任务的四种采样策略:一对预言机实验(根据模型是否已经能够正确屈折测试形式来选择数据),以及基于模型置信度高低、熵以及随机选择的策略。我们考察了每种策略在 30 种类型学特征多样的语言上的鲁棒性,并对 Nat"ugu 语进行了更深入的案例研究。结果表明,基于模型置信度和熵选择数据具有明显优势。不出所料,仅选择处理错误的形式进行进一步训练的预言机实验(作为语言学家/语言顾问反馈的代理)展现出最大的改进幅度。紧随其后的是选择低置信度和高熵预测的策略。我们还表明,尽管传统观点认为更大的数据集能带来更高的准确率,但引入更多高置信度或低熵形式的实例,或者模型已经能够正确屈折的形式,反而会降低模型性能。

关键词

引用

@article{arxiv.2210.14465,
  title  = {Eeny, meeny, miny, moe. How to choose data for morphological inflection},
  author = {Saliha Muradoglu and Mans Hulden},
  journal= {arXiv preprint arXiv:2210.14465},
  year   = {2022}
}

备注

EMNLP2022