低资源环境下利用合成数据生成对话回复
计算与语言
2022-04-07 v1
摘要
回复生成是自然语言处理(NLP)中的一项任务,即训练模型对人类语句作出回应。对话回复生成器更进一步,能够在先前回复的上下文中作出回应。尽管已有训练此类模型的技术,但它们都需要大量对话数据,而低资源语言并不总是具备这些条件。在本研究中,我们作出三点贡献。首先,我们发布了首个从菲律宾热门在线论坛收集的菲律宾语对话数据集,并将其命名为 PEx Conversations Dataset。其次,我们提出了一种针对菲律宾语的数据增强(DA)方法,通过采用 Tagalog RoBERTa 模型来扩充现有语料规模。最后,我们发布了首个能够基于前3条回复生成相关回复的菲律宾语对话回复生成器。借助补充的合成数据,与零合成数据训练相比,我们将回复生成器在 BERTScore 上的性能提升了至多 12.2%,在困惑度上提升了 10.7%,在内容词使用上提升了 11.7%。
引用
@article{arxiv.2204.02653,
title = {Using Synthetic Data for Conversational Response Generation in Low-resource Settings},
author = {Gabriel Louis Tan and Adrian Paule Ty and Schuyler Ng and Denzel Adrian Co and Jan Christian Blaise Cruz and Charibeth Cheng},
journal= {arXiv preprint arXiv:2204.02653},
year = {2022}
}