日语零指代消解中上下文数据增强的实证研究
计算与语言
2020-11-05 v2
摘要
零指代消解(ZAR)的一个关键问题是标注数据的稀缺性。本研究探讨了数据增强能在多大程度上有效缓解该问题。我们采用了一种最先进的数据增强方法,称为上下文数据增强(CDA),其利用预训练语言模型生成带标注的训练样本。已有报道表明,CDA 在包括文本分类和机器翻译在内的若干其他自然语言处理任务上表现良好。本研究解决了 CDA 的两个尚未充分探索的问题,即如何降低数据增强的计算成本以及如何保证生成数据的质量。我们还提出了两种将 CDA 适配于 ZAR 的方法:基于 [MASK] 的增强与语言控制的掩码。最终,在日语 ZAR 上的实验结果表明,我们的方法同时有助于准确率的提升与计算成本的降低。我们的深入分析揭示,与传统的 CDA 相比,所提方法能够改善增强训练数据的质量。
引用
@article{arxiv.2011.00948,
title = {An Empirical Study of Contextual Data Augmentation for Japanese Zero Anaphora Resolution},
author = {Ryuto Konno and Yuichiroh Matsubayashi and Shun Kiyono and Hiroki Ouchi and Ryo Takahashi and Kentaro Inui},
journal= {arXiv preprint arXiv:2011.00948},
year = {2020}
}
备注
13 pages, accepted by COLING 2020