中文

一种用于语言变体识别的低维表示

计算与语言 2017-05-31 v1

摘要

语言变体识别旨在为母语文本(如西班牙语、葡萄牙语、英语)标注其具体变体(如阿根廷、智利、墨西哥、秘鲁、西班牙;巴西、葡萄牙;英国、美国)。本文提出一种低维表示(LDR)方法,用于处理五种不同西班牙语变体的识别任务:阿根廷、智利、墨西哥、秘鲁和西班牙。我们将LDR方法与当前最先进的通用表示方法进行比较,结果显示准确率提升约35%。此外,我们将LDR与两种参考分布式表示模型进行对比。实验结果表明,LDR在保持竞争性性能的同时,将维度大幅降低——并提高了大数据适用性——每种变体仅需6个特征。我们还分析了所采用机器学习算法的行为及最具区分力的特征。最后,我们使用一个替代数据集测试了低维表示在另一组相似语言上的鲁棒性。

关键词

引用

@article{arxiv.1705.10754,
  title  = {A Low Dimensionality Representation for Language Variety Identification},
  author = {Francisco Rangel and Marc Franco-Salvador and Paolo Rosso},
  journal= {arXiv preprint arXiv:1705.10754},
  year   = {2017}
}