中文

面向历史文本规范化的少样本与零样本学习

计算与语言 2019-10-15 v2 机器学习

摘要

历史文本规范化通常依赖于小型训练数据集。近期工作表明,多任务学习可通过利用与相关数据集的协同效应带来显著改进,但针对不同多任务学习架构尚未有系统研究。本文评估了基于序列到序列的历史文本规范化的63种多任务学习配置,涵盖八种语言的十个数据集,使用自编码、字素到音素映射和词形还原作为辅助任务。我们观察到,当目标任务的训练数据有限时,跨语言一致且显著的改进;而当训练数据充足时,改进极小或无改进。我们还表明零样本学习优于简单但相对较强的恒等基线。

关键词

引用

@article{arxiv.1903.04870,
  title  = {Few-Shot and Zero-Shot Learning for Historical Text Normalization},
  author = {Marcel Bollmann and Natalia Korchagina and Anders Søgaard},
  journal= {arXiv preprint arXiv:1903.04870},
  year   = {2019}
}

备注

Accepted at DeepLo-2019