泰语中的错字语义
计算与语言
2022-06-22 v1
摘要
用户生成内容中充满错字。我们假设许多错字并非只是随机噪声,而是包含可被利用以用于语言理解任务的隐藏语义,而非仅是随机噪声。本文提出了一个细粒度标注的泰语错字语料库,并对错字意图及其可能语义进行分析,以更好地理解语料库中观察到的错字模式。此外,我们引入两种将错字语义纳入考虑的方法:错字平均嵌入(MAE)与错字语义词元(MST)。在情感分析任务上的实验证实了我们的总体假设:来自错字的附加语义可将微平均 F1 分数提升多达 0.4–2%,而盲目地将错字归一化是有害且次优的。
引用
@article{arxiv.2206.09680,
title = {Misspelling Semantics In Thai},
author = {Pakawat Nakwijit and Matthew Purver},
journal= {arXiv preprint arXiv:2206.09680},
year = {2022}
}
备注
To be published in LREC2022