如何评估非正式领域的词表示?
计算与语言
2019-11-14 v2 信息检索
机器学习
摘要
在大多数最先进的自然语言处理(NLP)应用中,多样化的词表示层出不穷。然而,由于缺少充分的评估数据集,如何高效评估诸如 Twitter 或论坛等非正式领域的此类词嵌入仍是一项持续挑战。我们通过弱监督基于模式的自举与自训练线性链条件随机场(CRF)的自动化方法,从 UrbanDictionary 中提取了大量变体拼写对。利用这些提取的关系对,我们提升了省略传统 NLP 流程文本规范化步骤并直接采用非正式领域非标准词表示的可能性。我们的代码已公开。
引用
@article{arxiv.1911.04669,
title = {How to Evaluate Word Representations of Informal Domain?},
author = {Yekun Chai and Naomi Saphra and Adam Lopez},
journal= {arXiv preprint arXiv:1911.04669},
year = {2019}
}