利用词汇变换与标签注入的 Twitter 数据无监督域适应
计算与语言
2023-07-21 v1
摘要
域适应是自然语言处理中一个重要且被广泛研究的问题。大量文献试图通过将源域上训练的模型适应到目标域来解决此问题。在本文中,我们从数据集的角度解决这个问题。我们通过简单的词汇变换修改源域数据集,以减小源数据集分布与目标数据集分布之间的域偏移。我们发现,在变换后的源域数据集上训练的模型表现显著优于零样本模型。使用我们提出的变换将标准英语转换为推文,我们达到了 92.14% 的无监督词性 (part-of-speech, POS) 标注准确率(零样本准确率为 81.54%),仅略低于 94.45% 的有监督性能。我们还使用我们提出的变换合成生成推文并扩充 Twitter 数据集,以实现 POS 标注的最先进性能。
引用
@article{arxiv.2307.10210,
title = {Unsupervised Domain Adaptation using Lexical Transformations and Label Injection for Twitter Data},
author = {Akshat Gupta and Xiaomo Liu and Sameena Shah},
journal= {arXiv preprint arXiv:2307.10210},
year = {2023}
}
备注
Accepted at WASSA at ACL 2023