面向历史文本规范化的少样本与零样本学习
计算与语言
2019-10-15 v2 机器学习
摘要
历史文本规范化通常依赖于小型训练数据集。近期工作表明,多任务学习可通过利用与相关数据集的协同效应带来显著改进,但针对不同多任务学习架构尚未有系统研究。本文评估了基于序列到序列的历史文本规范化的63种多任务学习配置,涵盖八种语言的十个数据集,使用自编码、字素到音素映射和词形还原作为辅助任务。我们观察到,当目标任务的训练数据有限时,跨语言一致且显著的改进;而当训练数据充足时,改进极小或无改进。我们还表明零样本学习优于简单但相对较强的恒等基线。
引用
@article{arxiv.1903.04870,
title = {Few-Shot and Zero-Shot Learning for Historical Text Normalization},
author = {Marcel Bollmann and Natalia Korchagina and Anders Søgaard},
journal= {arXiv preprint arXiv:1903.04870},
year = {2019}
}
备注
Accepted at DeepLo-2019