比较不同基于语言学的词嵌入在网络欺凌检测中的性能
计算与语言
2022-06-07 v1 人工智能
机器学习
摘要
在大多数情况下,词嵌入仅从原始词元(token)或某些情况下的词 lemma 中学习,这包括 BERT 等预训练语言模型。为探究捕捉词汇项与结构之间更深层次关系并过滤冗余信息的潜力,我们提出通过将形态、句法及其他类型的语言学信息与原始词元或 lemma 相结合来保留这些信息。例如,这意味着在所使用的词汇特征中纳入词性标注或依存关系信息。随后词嵌入可在这些组合上训练,而非仅基于原始词元。该方法也可在日后应用于大型语言模型的预训练,并可能提升其性能。这将有助于解决从语言学表征角度看更为复杂的问题,例如网络欺凌检测。
引用
@article{arxiv.2206.01950,
title = {Comparing Performance of Different Linguistically-Backed Word Embeddings for Cyberbullying Detection},
author = {Juuso Eronen and Michal Ptaszynski and Fumito Masui},
journal= {arXiv preprint arXiv:2206.01950},
year = {2022}
}